الخلاصة: كل مزوّد ذكاء اصطناعي يشغّل نوعين من الزواحف، والفرق يحدد إن كان يمكن اقتباسك. زواحف التدريب (GPTBot وClaudeBot وGoogle-Extended) تجمع المحتوى لنماذج مستقبلية؛ وزواحف البحث والاسترجاع (OAI-SearchBot وClaude-SearchBot وPerplexityBot) تجلب الصفحات للإجابة الآن مع اقتباسات. حجب روبوت استرجاع يزيلك من إجابات ذلك المحرك بالكامل. ومعظم المواقع التي تفشل هنا تفشل بالخطأ، إما بملف robots.txt قديم أو بزرّ Cloudflare يتجاوز ملفاً سليماً بصمت. افحص الطبقتين.
ماذا يعني "عدم حجب الروبوتات"؟
يعني التأكد أن زواحف الذكاء الاصطناعي التي تريدها تصل فعلاً إلى صفحاتك، عند طبقة robots.txt وطبقة الـCDN معاً. هذا الفحص الرابع عشر في قائمة السيو للذكاء الاصطناعي، وعملياً الذي تفشل فيه معظم المواقع دون أن تدري. يمكنك إتمام كل فحوصات الفحص التقني قبل الإقلاع الأخرى بإتقان، وكتابة محتوى محكم البنية والمصادر، وتبقى مع ذلك غير مرئي تماماً في إجابات الذكاء الاصطناعي لأن زاحفاً حُجب قبل ثلاث سنوات ولم يفحصه أحد.
ملف robots.txt ملف نصي في جذر نطاقك يخبر الزواحف بالمسارات التي يجوز لها جلبها. جرى توحيده كمعيار RFC 9309، لكنه طلب مهذب لا حاجز مفروض، فيعمل فقط مع الروبوتات التي تختار احترامه. وزواحف الذكاء الاصطناعي الكبرى تحترمه.
لماذا يهم الفصل بين التدريب والبحث إلى هذا الحد؟
لأنهما روبوتان منفصلان بمهمتين منفصلتين، وحجب الخطأ منهما له عواقب معاكسة. كل مزوّد كبير يشغّل أسطولاً مقسّماً بالغرض: زاحف تدريب يجمع المحتوى لإصدارات نماذج مستقبلية، وزاحف بحث أو استرجاع يفهرس الصفحات للإجابة عن الاستعلامات، وغالباً روبوت مستخدم يجلب صفحة لحظة أن يسأل عنها أحد.
الفصل هو جوهر الفحص. إن حجبت زاحف التدريب، تبقي محتواك خارج تدريب النماذج لكنك تظل مؤهلاً لاقتباسات بحث الذكاء الاصطناعي. وإن حجبت زاحف الاسترجاع، تزيل نفسك من إجابات ذلك المحرك بالكامل مهما كان محتواك جيداً. أي أن الموقع يستطيع اتخاذ قرار مدروس دقيق: الانسحاب من التدريب مع البقاء قابلاً للاقتباس. وما يجب ألا تفعله بالخطأ أبداً هو حجب روبوتات الاسترجاع فتختفي من بحث الذكاء الاصطناعي دون أن تدري.
أي زواحف يجب أن تعرفها بالاسم؟
التي تحدد ظهورك، مجمّعة بالمهمة:
- OpenAI: GPTBot (تدريب)، وOAI-SearchBot (يشغّل نتائج بحث ChatGPT)، وChatGPT-User (جلب حي حين ينقر مستخدم على اقتباس).
- Anthropic: ClaudeBot (تدريب)، وClaude-SearchBot (استرجاع لبحث Claude)، وClaude-User (جلب حي للمستخدم).
- Google: Google-Extended (ينسحب من تدريب Gemini دون التأثير في ترتيب بحث جوجل)، منفصل عن Googlebot نفسه.
- Perplexity: PerplexityBot (استرجاع لإجابات Perplexity).
- Common Crawl: CCBot (بيانات مفتوحة تُستخدم لتدريب نماذج كثيرة).
فخ يستحق التسمية: نصّا Anthropic القديمان anthropic-ai وclaude-web مهجوران. وملف robots.txt الذي يحجب هذين فقط لا يحجب زاحف Anthropic الحي، وهو الآن ClaudeBot. والقواعد المنسوخة من مثال 2023 تستهدف روتينياً أسماء لم تعد تفعل شيئاً.
لماذا طبقة الـCDN خطر أكبر من robots.txt؟
لأن جدار الحماية قد يتجاوز ملف robots.txt سليماً تماماً بصمت. Cloudflare وطبقات الـCDN والأمان المشابهة تقدّم زرّ "كاشطات وزواحف الذكاء الاصطناعي" أو "احجب روبوتات الذكاء الاصطناعي" الذي يعامل روبوتات الاسترجاع مثل OAI-SearchBot وPerplexityBot معاملة الكاشطات الخبيثة نفسها. فإن كان ذلك الزرّ مفعّلاً، يستطيع robots.txt أن يقول "اسمح" طوال اليوم ويظل الروبوت يتلقى 403 عند الحافة قبل أن يصل إلى ملفك أصلاً. ونسبة كبيرة من المواقع تحجب زواحف الذكاء الاصطناعي بهذه الطريقة دون أن تدري، ولهذا للفحص طبقتان لا واحدة.
فالتحقق مهمة من خطوتين. اقرأ ملف robots.txt وتأكد أن روبوتات الاسترجاع مسموحة، ثم افحص الـCDN أو WAF وتأكد أنه لا يحجبها عند الحافة ولا يتجاوز ملف robots.txt في الأصل. وقد قاست دراسات عبر 2026 تراجعاً ملموساً في الزيارات لدى الناشرين الذين يحجبون زواحف الذكاء الاصطناعي، فهذه مسألة إيراد لا مسألة نظرية.
كيف تقرر سياستك؟
قرّر لكل فئة، عن قصد، بدلاً من قبول ما شحنه نظام إدارة المحتوى. الوضع الشائع لعلامة تريد الظهور: اسمح بروبوتات البحث والاسترجاع لتبقى قابلاً للاقتباس، واتخذ قراراً مدروساً بشأن روبوتات التدريب بحسب رغبتك في وجود محتواك في تدريب النماذج. والحل الوسط المعقول يسمح بكل شيء ويبقي قاعدة على مستوى الخادم جاهزة لأي روبوت يسيء التصرف.
حاجزان مهما كان الوضع. أبقِ المسارات الحساسة (الإدارة، وتسجيل الدخول، والدفع، والحساب) محجوبة لكل الروبوتات، ذكاءً اصطناعياً أو غيره. وتذكّر أن خطأ سطر واحد هنا خطير في الاتجاهين: وسم Disallow شارد قد يزيل موقعك من جوجل بين ليلة وضحاها، فاختبر التغييرات على بيئة التجهيز أو بأداة اختبار robots.txt في Search Console قبل الدفع إلى الإنتاج.
السماح لبحث الذكاء الاصطناعي مقابل حجبه بالخطأ
| الإشارة | قابل للوصول من الذكاء الاصطناعي | محجوب بالخطأ |
|---|---|---|
| robots.txt | روبوتات الاسترجاع مسموحة | ملف 2023 منسوخ يحجبها |
| النصوص المهجورة | يستهدف ClaudeBot الحي | يحجب anthropic-ai وclaude-web فقط |
| طبقة الـCDN | مؤكَّد أنه لا يتجاوز robots.txt | زرّ "احجب روبوتات الذكاء" مفعّل بصمت |
| تدريب مقابل بحث | قرار مدروس لكل فئة | روبوتات الاسترجاع محجوبة دون علم |
| المسارات الحساسة | محجوبة لكل الروبوتات | مكشوفة أو محجوبة بلا اتساق |
| النتيجة | مؤهل لاقتباسات الذكاء الاصطناعي | غير مرئي في إجابات الذكاء الاصطناعي |
كيف نطبق القاعدة في HBS؟
نتحقق من الطبقتين قبل اعتبار الموقع منشوراً: robots.txt يسمح بزواحف الاسترجاع ويستهدف النصوص الحالية لا المهجورة، وطبقة Cloudflare أو الـCDN مؤكَّد أنها لا تحجب روبوتات الذكاء الاصطناعي بصمت ولا تتجاوز الملف الأصلي. ونراجع هذا فصلياً، لأن مشهد الروبوتات يتحرك بسرعة وملف كان صحيحاً العام الماضي قد يحجب زاحفاً انفصل حديثاً اليوم. واكتشاف حجب بالخطأ من أعلى الإصلاحات أثراً في فحصنا التقني قبل الإقلاع، وهو ناتج الأسبوع الأول في أعمال حلول السيو المتقدمة التي نقدمها، لأن علامة غير مرئية لروبوتات الاسترجاع غير مرئية في بحث الذكاء الاصطناعي مهما كان كل ما عداها جيداً.
الفحص الذي يقرر كل شيء بهدوء
يمكنك الفوز بكل جزء آخر من هذه القائمة وتخسر بحث الذكاء الاصطناعي بالكامل إن لم يستطع زاحف استرجاع الوصول إليك. افحص robots.txt، وافحص الـCDN، واستهدف النصوص الحية، واتخذ قرارات السماح والحجب عن قصد. لو مش متأكد إن محركات الذكاء الاصطناعي بتقدر تزحف لموقعك فعلاً، فريق حلول السيو المتقدمة في HBS يقدر يدقّق الطبقتين، ويصلّح الحجب بالخطأ، ويأكّد إنك مؤهل للاقتباس عبر ChatGPT وClaude وPerplexity وجوجل. اطلب مراجعة مجانية واعرف إن كانت المحركات تقدر توصلك أصلاً.




