أي بوتات الذكاء الاصطناعي يجب أن تحظرها؟ بوتات البحث وبوتات التدريب
بقلم محمد هادري
يبدو حظر بوتات الذكاء الاصطناعي كأنه زر واحد، لكن كل شركة كبيرة في هذا المجال تستخدم أكثر من بوت، ولكل بوت مهمة. واحد يبني فهرس البحث، وواحد يفتح صفحتك حين يسأل عنها مستخدم، وواحد يجمع الصفحات التي قد تُستخدم في تدريب النماذج القادمة. إذا حظرت بوت البحث فقد يختفي موقعك من إجابات الذكاء الاصطناعي. وإذا حظرت بوت التدريب وحده يبقى موقعك في نتائج بحثها، لأن هذه الشركات تتعامل مع الأمرين كقرارين منفصلين في وثائقها.
وزادت أهمية هذا منذ 15 سبتمبر 2026، حين غيّرت Cloudflare ما تفعله إعدادات بوتات الذكاء الاصطناعي عندها. إذا كان موقعك يعمل خلف Cloudflare، فخيار Block في تلك القائمة لم يعد يعني ما كان يعنيه.
ثلاث مهام وثلاثة أنواع من البوتات
- بوتات البحث تبني الفهرس الذي يعتمد عليه بحث الذكاء الاصطناعي حين يجيب ويذكر مصادره، وحظرها يُخرج موقعك من تلك الإجابات. تقول OpenAI إن المواقع التي تمنع
OAI-SearchBotلا تظهر في إجابات بحث ChatGPT. - بوتات المستخدم تفتح الصفحة في اللحظة التي يسأل فيها شخص عنها، ولا تزحف على المواقع من تلقاء نفسها. تقول OpenAI إن قواعد robots.txt قد لا تنطبق على
ChatGPT-Userلأن الطلب بدأه شخص، وتقول Google الشيء نفسه عن أدوات الجلب التي يشغّلها المستخدم. - بوتات التدريب تجمع صفحات قد تُستخدم في تدريب نماذج قادمة. حظرها يُبعد محتواك عن هذا التدريب، والشركات تعامله كقرار منفصل عن البحث.
هكذا تقسّم الشركات الأربع بوتاتها، بحسب وثائق كل شركة:
| الشركة | البحث | طلبات المستخدم | التدريب |
|---|---|---|---|
| OpenAI | OAI-SearchBot | ChatGPT-User | GPTBot |
| Anthropic | Claude-SearchBot | Claude-User | ClaudeBot |
| Perplexity | PerplexityBot | Perplexity-User | لا يوجد |
Googlebot | Google-Agent | Google-Extended |
تفصيلان يسهل أن يفوتاك. تقول Perplexity إن PerplexityBot لا يُستخدم لجمع محتوى لتدريب النماذج، فلا يوجد عندها بوت تدريب تحظره. أما Google-Extended فلا يزحف على أي شيء بنفسه. هو اسم تكتبه في robots.txt لتخبر Google هل يحق لها استخدام صفحاتك في تدريب نماذج Gemini، وفي دعم إجابات تطبيقات Gemini بمحتواك. وتقول Google إنه لا يؤثر على ظهور موقعك في بحث Google ولا على ترتيبه، لكن حظره يمنع تطبيقات Gemini من الاعتماد على صفحاتك في إجاباتها.
ما الذي غيّرته Cloudflare
تعمل Cloudflare أمام جزء كبير من مواقع الإنترنت، لذلك تحدد إعداداتها في مواقع كثيرة أي البوتات تمر. ثلاثة تغييرات هذا العام تهمك:
- 1 يوليو 2026: صار لكل خطط Cloudflare، ومنها الخطة المجانية، إعدادات منفصلة لثلاثة أنواع من زيارات الذكاء الاصطناعي: البحث (Search) والوكلاء (Agent) والتدريب (Training).
- 21 أغسطس 2026: ميزة Bot Preference Sync، التي تجعل ملف robots.txt يطابق اختياراتك في لوحة التحكم. وتضيف سطورها فوق ما هو مكتوب في ملفك أصلاً.
- 15 سبتمبر 2026: صار خيار Block يوقف أيضاً البوتات التي تخدم البحث والتدريب معاً، مثل بوت Google وبوت Bing وبوت Apple، أي أن حظرها يُخرجك من بحثها أيضاً. والخيار الذي يوقف التدريب ويُبقي البحث اسمه الآن Disallow AI Training. أما خيار Block AI bots القديم وميزة managed robots.txt فسيتوقفان.
إذا كنت قد فعّلت خيار Block AI bots القديم، فقد نقلتك Cloudflare إلى الإعدادات الجديدة تلقائياً: البحث مسموح، والتدريب على Disallow AI Training، والوكلاء محظورون في الصفحات التي تعرض إعلانات. ونصيحتها لعملائها الحاليين أنه لا شيء عليهم فعله في أغلب الحالات. الخطر في القائمة الجديدة: إذا اخترت Block لتمنع الذكاء الاصطناعي، فأنت الآن تمنع أيضاً بحث Google، وبحث Bing، وبحث Apple.
وأرقام Cloudflare نفسها تبيّن ما تختاره أغلب المواقع: أقل من 1% من المواقع عندها تحظر بوتات البحث، بينما 17% منها تمنع تدريب الذكاء الاصطناعي بطريقة ما.
افحص موقعك في أربع خطوات
- اقرأ ملف robots.txt. افتحه في المتصفح من جذر موقعك، مثل
example.com/robots.txt. إذا وجدت مجموعة فيهاUser-agent: *ثمDisallow: /فهي تغلق الموقع كله أمام كل بوت يلتزم بالملف. وإذا وجدت مجموعة لبوت بحث مثلOAI-SearchBotفيهاDisallow: /فهي تُخرجك من بحث تلك الأداة. وإذا كنت تستخدم Cloudflare فانظر هنا أيضاً، لأن اختياراتك في لوحة التحكم قد تُكتب في هذا الملف. - افتح إعدادات الذكاء الاصطناعي في Cloudflare إن كنت تستخدمها. يجب أن يكون البحث على Allow. وإذا كنت لا تريد استخدام محتواك في التدريب فاختر Disallow AI Training بدل Block. أما الوكلاء فهم أدوات ذكاء اصطناعي تعمل نيابة عن شخص، مثل مساعد يفتح صفحتك لأن مستخدماً سأل عنها. لا تحظرهم إلا لسبب واضح. تقول Anthropic إن منع بوت المستخدم عندها قد يقلل ظهور موقعك حين يبحث الناس عبر Claude.
- افحص جدار الحماية أيضاً. قاعدة في جدار الحماية، أو وضع للحماية من البوتات، أو إضافة أمان، قد ترد البوت برسالة خطأ قبل أن يقرأ robots.txt أصلاً. تنشر OpenAI عناوين IP التي يستخدمها بوت البحث عندها، وكذلك تفعل Perplexity، وتطلب الشركتان من المواقع السماح لها. إذا ظهر في سجلات الأمان أن هذه البوتات تحصل على أخطاء، فأضف قاعدة تسمح لها بالدخول. أما Anthropic فتنبّه إلى أن حظر عناوين IP الخاصة بها ليس طريقة موثوقة لإبعاد بوتاتها، وتطلب استخدام robots.txt لذلك.
- إذا كانت منصة تستضيف موقعك، مثل منصات المتاجر الإلكترونية، فقد لا تتحكم في جدار الحماية أو في robots.txt أصلاً. اسأل المنصة كيف تتعامل مع بوتات البحث في الذكاء الاصطناعي، وهل يمكنك تغيير ذلك.
ملف robots.txt يُبقي البحث ويرفض التدريب
هذا المثال لا يمنع بوتات البحث ولا بوتات المستخدم، ويحظر بوتات التدريب الثلاثة المذكورة في الجدول. والمجموعة الأخيرة تعبّر عن الرغبة نفسها في سطر Content-Signal، وهي صيغة نشرتها Cloudflare في 2025 ولها ثلاث قيم: قيمة search للبحث، وقيمة ai-input لاستخدام صفحاتك في إجابات الذكاء الاصطناعي، وقيمة ai-train للتدريب. انتبه إلى أن search=yes وحدها لا تشمل الإجابات التي يكتبها الذكاء الاصطناعي، فهذه مكانها ai-input.
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=no
Allow: /
Sitemap: https://www.example.com/sitemap.xmlثلاثة أمور قبل أن تنسخه. البوت الذي يجد مجموعة باسمه يتبع تلك المجموعة وحدها (RFC 9309)، فإذا كنت تمنع مسارات خاصة تحت User-agent: * فكرّرها في أي مجموعة تضيفها. وتقول OpenAI إن أنظمة البحث عندها قد تحتاج نحو 24 ساعة لتلاحظ التغيير. وإذا كنت تفضّل ألا تحظر أحداً فاكتفِ بسطر Content-Signal، فهو يعبّر عن رغبتك دون أن يغلق الباب، وهذا ما نفعله في موقعنا.
ماذا يفحص فحصنا المجاني
يقرأ فحص Mariy AI المجاني ملف robots.txt ضمن فحوصاته. يبيّن هل يحظر الملف موقعك كله، وهل يحظر أي بوت ذكاء اصطناعي بالاسم، وهل يذكر بوتات الذكاء الاصطناعي أصلاً، وهل فيه سطر Content-Signal. ولا يحسب عليك حظر البوتات المخصصة للتدريب فقط: حظر GPTBot أو ClaudeBot أو Applebot-Extended أو CCBot يعني فقط أنك لا تريد أن تُستخدم صفحاتك في التدريب. لكنه يحسب حظر Google-Extended، لأن حظره يمنع أيضاً تطبيقات Gemini من الاعتماد على صفحاتك في إجاباتها، لذلك يظهر المثال أعلاه بنتيجة جزئية. إذا حظرته عن قصد فهذه النتيجة متوقعة.
أما جدار الحماية فلا يستطيع الفحص رؤيته. الفحص يجلب موقعك من خوادمنا نحن، وعناوينها تختلف عن عناوين بوتات OpenAI وبوتات Anthropic، لذلك قد تمر قاعدة تمنع البوتات الحقيقية دون أن نلاحظها. لهذا الجزء، الخطوة 3 أعلاه هي طريقة الفحص.
المصادر
- OpenAI: Overview of OpenAI Crawlers
- Anthropic: Does Anthropic crawl data from the web, and how can site owners block the crawler?
- Perplexity: Perplexity Crawlers
- Google: Google’s common crawlers · آخر تحديث 14 يوليو 2026
- Google: Google User-Triggered Fetchers
- Cloudflare: Your site, your rules: new AI traffic options for all customers · 1 يوليو 2026
- Cloudflare: Say it once: introducing Bot Preference Sync · 21 أغسطس 2026
- Cloudflare: Have it both ways: stay discoverable in search while disallowing AI training · 15 سبتمبر 2026
- Cloudflare: Giving users choice with Cloudflare’s new Content Signals Policy · 24 سبتمبر 2025
- RFC 9309: Robots Exclusion Protocol