كيفية تكوين قواعد جدار حماية تطبيقات الويب Cloudflare للسماح بـ Perplexity و ChatGPT مع حظر برامج الزحف العدوانية
فهم إدارة روبوتات الذكاء الاصطناعي في Cloudflare: لماذا يُعد زر الحظر الشامل خطيرًا
تحظر ميزة "حظر روبوتات الذكاء الاصطناعي" بنقرة واحدة في Cloudflare جميع برامج زحف الذكاء الاصطناعي دون تمييز، بما في ذلك محركات البحث المفيدة مثل Perplexity و ChatGPT التي تجلب حركة مرور عضوية كبيرة إلى موقعك. يمنع هذا الخيار الجذري فهرسة محتواك بواسطة منصات البحث بالذكاء الاصطناعي من الجيل التالي، مما يجعل موقعك غير مرئي فعليًا لملايين المستخدمين الذين يعتمدون على أدوات البحث المدعومة بالذكاء الاصطناعي لاكتشاف المعلومات.
الأهمية الاستراتيجية للإدارة الانتقائية لروبوتات الذكاء الاصطناعي
تأتي حركة المرور على الويب الحديثة بشكل متزايد من محركات البحث والمساعدات المدعومة بالذكاء الاصطناعي. تمثل Perplexity و ChatGPT Search ونظرة Google الذكية والمنصات المماثلة مستقبل استرجاع المعلومات. يؤدي حظر برامج الزحف المشروعة هذه أثناء استخدام حظر روبوتات الذكاء الاصطناعي الشامل في Cloudflare إلى إنشاء فجوة حرجة في الظهور يمكن أن تؤثر بشدة على قابلية اكتشاف موقعك ومدى وصوله العضوي.
يكمن الحل في تطبيق قواعد جدار حماية تطبيقات الويب (WAF) الدقيقة التي تميز بين برامج زحف الذكاء الاصطناعي المفيدة وأدوات الاستخراج العدوانية التي تستهلك النطاق الترددي دون تقديم قيمة. يوفر هذا الدليل تعليمات شاملة لتكوين قواعد WAF في Cloudflare التي تحمي بنيتك التحتية مع الحفاظ على الظهور في أنظمة البحث بالذكاء الاصطناعي.
معرّفات وكيل المستخدم ونطاقات IP الرئيسية لبرامج زحف الذكاء الاصطناعي
قبل تكوين قواعد WAF، يجب أن تفهم طرق التعريف التي تستخدمها برامج زحف الذكاء الاصطناعي المشروعة. يوفر الجدول التالي معلومات شاملة حول معرّفات وكيل المستخدم الرئيسية لروبوتات الذكاء الاصطناعي ونطاقات IP المرتبطة بها:
| المزود | رمز وكيل المستخدم | مثال كامل لوكيل المستخدم | التحقق من نطاق IP | رمز Robots.txt |
|---|---|---|---|---|
| Perplexity AI | PerplexityBot | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; PerplexityBot/1.0; +https://perplexity.ai/bot) | التحقق عبر البحث العكسي لـ DNS | PerplexityBot |
| OpenAI (ChatGPT) | GPTBot | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; GPTBot/1.0; +https://openai.com/gptbot) | ملف JSON منشور على openai.com/gptbot.json | GPTBot |
| OpenAI (SearchGPT) | OAI-SearchBot | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; OAI-SearchBot/1.0; +https://openai.com/searchbot) | ملف JSON منشور على openai.com/searchbot.json | OAI-SearchBot |
| Google (Gemini) | Google-Extended | Mozilla/5.0 (compatible; Google-Extended/1.0; +http://www.google.com/bot.html) | التحقق عبر نطاقات IP من Google | Google-Extended |
| Anthropic (Claude) | anthropic-ai | anthropic-ai (compatible; Claude-Web/1.0; +https://anthropic.com/bot) | التحقق عبر البحث العكسي لـ DNS | anthropic-ai |
| Apple (Applebot) | Applebot | Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/605.1.15 (KHTML, like Gecko) Version/17.4 Safari/605.1.15 (Applebot/0.1; +http://www.apple.com/go/applebot) | 17.0.0.0/8 (النطاق الأساسي) | Applebot |
| Cohere | cohere-ai | cohere-ai (compatible; CohereBot/1.0; +https://cohere.com/bot) | التحقق عبر البحث العكسي لـ DNS | cohere-ai |
| Meta AI | FacebookBot | facebookexternalhit/1.1 (+http://www.facebook.com/externalhit_uatext.php) | ASN منشور: AS32934, AS63293 | FacebookBot |
تكوين قواعد WAF المخصصة للسماح ببرامج زحف الذكاء الاصطناعي المفيدة
توفر القواعد المخصصة لـ WAF في Cloudflare المرونة لإنشاء سياسات متطورة لإدارة الروبوتات. يسمح التكوين التالي ببرامج زحف البحث بالذكاء الاصطناعي المشروعة مع حظر أدوات الاستخراج العدوانية والروبوتات غير المصرح بها.
الخطوة 1: الوصول إلى القواعد المخصصة لـ WAF في Cloudflare
- سجّل الدخول إلى لوحة تحكم Cloudflare الخاصة بك
- حدد النطاق الذي تريد تكوينه
- انتقل إلى الأمان ← WAF ← القواعد المخصصة
- انقر على إنشاء قاعدة لبدء تكوين مجموعة القواعد المخصصة
الخطوة 2: إنشاء قاعدة سماح لبرامج زحف الذكاء الاصطناعي المشروعة
أنشئ قاعدة بالتكوين التالي:
اسم القاعدة: السماح ببرامج زحف البحث بالذكاء الاصطناعي المشروعة
التعبير:
(http.user_agent contains "PerplexityBot") or (http.user_agent contains "GPTBot") or (http.user_agent contains "OAI-SearchBot") or (http.user_agent contains "Google-Extended") or (http.user_agent contains "anthropic-ai") or (http.user_agent contains "Applebot") or (http.user_agent contains "cohere-ai") or (http.user_agent contains "FacebookBot" and not http.user_agent contains "facebookexternalhit")
الإجراء: السماح
الأولوية: اضبطها على 1 (أعلى أولوية لضمان تنفيذ هذه القاعدة أولاً)
الخطوة 3: إنشاء قاعدة حظر لأدوات الاستخراج العامة العدوانية
بعد السماح ببرامج الزحف المشروعة، أنشئ قاعدة ثانوية لحظر أدوات الاستخراج العدوانية المعروفة:
اسم القاعدة: حظر أدوات الاستخراج العدوانية والروبوتات غير المصرح بها
التعبير:
(http.user_agent contains "scrapy") or (http.user_agent contains "python-requests") or (http.user_agent contains "curl") or (http.user_agent contains "wget") or (http.user_agent contains "go-http-client") or (http.user_agent contains "axios") or (http.user_agent contains "node-fetch") or (http.user_agent eq "") or (http.user_agent contains "Bytespider") or (http.user_agent contains "PetalBot") or (http.user_agent contains "AhrefsBot" and not cf.bot_management.verified_bot) or (http.user_agent contains "SemrushBot" and not cf.bot_management.verified_bot) or (http.user_agent contains "DotBot") or (http.user_agent contains "MJ12bot") or (http.user_agent contains "BLEXBot")
الإجراء: الحظر
الأولوية: اضبطها على 2
الخطوة 4: تطبيق قواعد التحدي لأنماط حركة المرور المشبوهة
بالنسبة لحركة المرور التي لا تطابق معايير السماح أو الحظر ولكنها تُظهر أنماطًا مشبوهة، طبّق قاعدة تحدي:
اسم القاعدة: تحدي السلوك الشبيه بالروبوتات المشبوه
التعبير:
(cf.bot_management.score lt 30) and not (cf.bot_management.verified_bot) and not (http.user_agent contains "PerplexityBot") and not (http.user_agent contains "GPTBot") and not (http.user_agent contains "OAI-SearchBot") and not (http.user_agent contains "Google-Extended") and not (http.user_agent contains "Applebot")
الإجراء: التحدي المُدار
الأولوية: اضبطها على 3
تطبيق قواعد تحديد المعدل المخصصة لحماية نقاط نهاية API
يوفر تحديد المعدل طبقة حماية إضافية ضد إساءة استخدام الاستخراج، خاصة لنقاط نهاية API والصفحات كثيفة الموارد. اتبع هذه الخطوات لتكوين تحديد معدل ذكي لا يؤثر على برامج زحف الذكاء الاصطناعي المشروعة:
الخطوة 1: الانتقال إلى قواعد تحديد المعدل
- في لوحة تحكم Cloudflare، انتقل إلى الأمان ← WAF ← قواعد تحديد المعدل
- انقر على إنشاء قاعدة
الخطوة 2: تكوين تحديد معدل نقاط نهاية API
اسم القاعدة: تحديد معدل نقاط نهاية API مع استثناء برامج زحف الذكاء الاصطناعي
التعبير:
(http.request.uri.path contains "/api/") and not (http.user_agent contains "PerplexityBot") and not (http.user_agent contains "GPTBot") and not (http.user_agent contains "OAI-SearchBot") and not (http.user_agent contains "Applebot") and not (cf.bot_management.verified_bot)
الخصائص:
- الطلبات: 100 طلب
- الفترة: 60 ثانية
- طريقة العد: العد حسب عنوان IP
الإجراء: الحظر لمدة ساعة واحدة
الخطوة 3: تكوين تحديد معدل صفحات المحتوى
بالنسبة لصفحات المحتوى، طبّق حدود معدل أكثر سخاءً تستوعب أنماط القراءة المشروعة:
اسم القاعدة: تحديد معدل صفحات المحتوى
التعبير:
(http.request.uri.path contains "/blog/" or http.request.uri.path contains "/articles/") and not (http.user_agent contains "PerplexityBot") and not (http.user_agent contains "GPTBot") and not (http.user_agent contains "OAI-SearchBot") and not (http.user_agent contains "Google-Extended") and not (http.user_agent contains "Applebot") and not (cf.bot_management.verified_bot)
الخصائص:
- الطلبات: 300 طلب
- الفترة: 300 ثانية (5 دقائق)
- طريقة العد: العد حسب عنوان IP
الإجراء: التحدي المُدار
الخطوة 4: تطبيق تحديد معدل برامج الزحف العدوانية
أنشئ حد معدل صارم خصيصًا لبرامج الزحف العدوانية المعروفة التي لم يتم حظرها بشكل كامل:
اسم القاعدة: تقييد برامج الزحف العدوانية
التعبير:
(http.user_agent contains "AhrefsBot") or (http.user_agent contains "SemrushBot") or (http.user_agent contains "MJ12bot") or (cf.bot_management.score lt 20 and not cf.bot_management.verified_bot)
الخصائص:
- الطلبات: 10 طلبات
- الفترة: 60 ثانية
- طريقة العد: العد حسب عنوان IP
الإجراء: الحظر لمدة 24 ساعة
الخطوة 5: مراقبة وضبط حدود المعدل
- انتقل إلى الأمان ← الأحداث لمراقبة القواعد المُفعّلة
- راجع سجل النشاط للكشف عن النتائج الإيجابية الخاطئة التي تؤثر على حركة المرور المشروعة
- اضبط عتبات حد المعدل بناءً على أنماط حركة المرور النموذجية لموقعك
- استخدم التحليلات ← الأمان لتحديد أنماط أدوات الاستخراج الناشئة
- حدّث قائمة السماح الخاصة بك كل ربع سنة مع ظهور محركات بحث ذكاء اصطناعي جديدة
التكوين المتقدم: التحقق من نطاق IP
يمكن انتحال سلاسل وكيل المستخدم، مما يجعل التحقق من نطاق IP طريقة تحقق ثانوية أساسية. طبّق هذه القواعد المتقدمة لتعزيز الأمان:
التحقق من نطاق IP للروبوتات المُتحقق منها
أنشئ قاعدة تتطلب كلاً من وكيل المستخدم الصحيح والتحقق من نطاق IP للمحتوى عالي القيمة:
(http.request.uri.path contains "/premium/") and ( (http.user_agent contains "GPTBot" and not cf.bot_management.verified_bot) or (http.user_agent contains "PerplexityBot" and not cf.bot_management.verified_bot) )
الإجراء: التحدي المُدار
تتحدى هذه القاعدة برامج الزحف التي تدّعي أنها روبوتات ذكاء اصطناعي مشروعة ولكنها لا تأتي من نطاقات IP مُتحقق منها، مما يحمي المحتوى المميز من محاولات الانتحال.
أفضل ممارسات المراقبة والصيانة
تتطلب إدارة قواعد WAF الفعالة مراقبة وتعديلاً مستمرين. طبّق أفضل الممارسات التالية:
- المراجعة الأسبوعية: تحقق من أحداث الأمان للكشف عن حركة المرور المشروعة المحظورة واضبط القواعد وفقًا لذلك
- التحليل الشهري: راجع بيانات التحليلات لتحديد معرّفات وكيل المستخدم الجديدة لبرامج الزحف وأنماط الاستخراج الناشئة
- التحديثات الفصلية: حدّث قائمة السماح الخاصة بك مع إطلاق محركات بحث ذكاء اصطناعي جديدة وتعديل المحركات الحالية لبرامج الزحف الخاصة بها
- تكوين التنبيهات: أعد إعداد إشعارات Cloudflare للارتفاعات غير العادية في حركة المرور المحظورة
- التوثيق: احتفظ بتوثيق داخلي لتغييرات القواعد والمنطق وراء كل تكوين
- بروتوكول الاختبار: قبل نشر قواعد جديدة في الإنتاج، اختبرها في وضع "السجل" لتحديد المشكلات المحتملة
التنسيق مع Robots.txt
يجب أن تكمل قواعد WAF توجيهات robots.txt الخاصة بك، وليس استبدالها. حافظ على نهج منسق:
# السماح ببرامج زحف الذكاء الاصطناعي المفيدة User-agent: PerplexityBot Allow: / User-agent: GPTBot Allow: / User-agent: OAI-SearchBot Allow: / User-agent: Google-Extended Allow: / User-agent: Applebot Allow: / User-agent: anthropic-ai Allow: / # حظر أدوات الاستخراج العدوانية User-agent: Bytespider Disallow: / User-agent: PetalBot Disallow: / User-agent: AhrefsBot Crawl-delay: 10 Disallow: /api/ User-agent: SemrushBot Crawl-delay: 10 Disallow: /api/
اعتبارات تأثير الأداء
تُنفذ قواعد WAF على كل طلب، لذا فإن التحسين أمر بالغ الأهمية للحفاظ على أداء الموقع:
- ترتيب القواعد: ضع القواعد الأكثر تطابقًا بشكل متكرر (قواعد السماح لبرامج الزحف الشائعة) بأولوية أعلى لتقليل وقت المعالجة
- كفاءة التعبير: استخدم مطابقة السلسلة البسيطة (contains) بدلاً من التعبيرات النمطية المعقدة عندما يكون ذلك ممكنًا
- دمج القواعد: ادمج الشروط ذات الصلة في قواعد واحدة بدلاً من إنشاء قواعد متعددة متداخلة
- تكامل التخزين المؤقت: تأكد من أن قواعد WAF لا تتداخل مع التخزين المؤقت لـ Cloudflare من خلال تجنب التحديات غير الضرورية على الموارد القابلة للتخزين المؤقت
- الاعتبارات الجغرافية: بالنسبة للمحتوى الخاص بمنطقة معينة، أضف مرشحات جغرافية لتقليل تقييم القواعد غير الضروري
الأسئلة الشائعة
لماذا لا يجب عليّ استخدام ميزة "حظر روبوتات الذكاء الاصطناعي" بنقرة واحدة في Cloudflare؟
حظر روبوتات الذكاء الاصطناعي الشامل في Cloudflare هو أداة عشوائية تحظر جميع برامج زحف الذكاء الاصطناعي، بما في ذلك البرامج المفيدة مثل Perplexity و ChatGPT Search وميزات الذكاء الاصطناعي من Google. تجلب هذه المنصات حركة مرور عضوية كبيرة وتمثل مستقبل البحث. يجعل حظرها محتواك غير مرئي لملايين المستخدمين الذين يعتمدون على أدوات البحث المدعومة بالذكاء الاصطناعي. تسمح لك قواعد WAF المخصصة بالسماح بشكل انتقائي بمحركات البحث بالذكاء الاصطناعي المشروعة مع حظر أدوات الاستخراج العدوانية التي لا توفر قيمة.
كيف أتحقق من أن قواعد WAF الخاصة بي تعمل بشكل صحيح؟
راقب قواعدك من خلال لوحة معلومات أحداث الأمان في Cloudflare (الأمان ← الأحداث). يُظهر هذا بيانات في الوقت الفعلي حول القواعد التي يتم تفعيلها وحركة المرور التي تؤثر عليها. ابدأ القواعد الجديدة في وضع "السجل" بدلاً من وضع "الحظر" لمراقبة سلوكها دون التأثير على حركة المرور. راجع سجل النشاط يوميًا خلال الأسبوع الأول بعد تطبيق قواعد جديدة للكشف عن أي نتائج إيجابية خاطئة. يمكنك أيضًا استخدام أوامر curl مع سلاسل وكيل مستخدم مختلفة لاختبار قواعدك يدويًا.
ما الفرق بين إجراءات "الحظر" و"التحدي المُدار"؟
يرفض "الحظر" الوصول فورًا دون إتاحة الفرصة للزائر للمتابعة، ويُرجع خطأ 403 Forbidden. هذا مناسب للروبوتات الضارة المعروفة وأدوات الاستخراج العدوانية. يقدم "التحدي المُدار" تحديًا ذكيًا يمكن للمتصفحات المشروعة اجتيازه تلقائيًا مع حظر الروبوتات. يحدد نظام Cloudflare نوع التحدي المناسب (غير مرئي، تحدي JavaScript، أو CAPTCHA) بناءً على خصائص الطلب. استخدم التحدي المُدار لحركة المرور المشبوهة التي قد تتضمن مستخدمين مشروعين، والحظر للمصادر الضارة المؤكدة.
كم مرة يجب عليّ تحديث قائمة السماح الخاصة ببرامج زحف الذكاء الاصطناعي؟
راجع وحدّث قائمة السماح الخاصة بك كل ربع سنة على الأقل، حيث يتطور مشهد البحث بالذكاء الاصطناعي بسرعة. تُطلق محركات بحث ذكاء اصطناعي جديدة بانتظام، وقد تغير المحركات الحالية معرّفات وكيل المستخدم أو نطاقات IP الخاصة ببرامج الزحف. اشترك في إعلانات الشركات الرئيسية للذكاء الاصطناعي (OpenAI و Anthropic و Google و Perplexity) للبقاء على اطلاع بتغييرات برامج الزحف. راقب سجل أحداث الأمان الخاص بك للكشف عن معرّفات وكيل المستخدم المحظورة التي قد تكون برامج زحف جديدة مشروعة. عند إطلاق منتجات بحث ذكاء اصطناعي رئيسية (مثل ChatGPT Search أو ميزات الذكاء الاصطناعي الجديدة من Google)، حدّث قواعدك فورًا للحفاظ على الظهور.
هل يمكن لبرامج زحف الذكاء الاصطناعي المشروعة انتحال معرّفات وكيل المستخدم الخاصة بها لتجاوز قواعدي؟
بينما يمكن انتحال معرّفات وكيل المستخدم، لا تنخرط شركات الذكاء الاصطناعي المشروعة في هذه الممارسة لأنها ستضر بسمعتها وتنتهك إرشادات مشرفي المواقع. ومع ذلك، قد ينتحل الجهات الفاعلة الضارة معرّفات وكيل المستخدم لبرامج الزحف المشروعة. لهذا السبب يُعد التحقق من نطاق IP أمرًا بالغ الأهمية. استخدم حقل cf.bot_management.verified_bot في Cloudflare، الذي يتحقق من أن الطلبات التي تدّعي أنها من روبوتات معروفة تأتي فعلاً من نطاقات IP مُتحقق منها. بالنسبة للمحتوى عالي القيمة، طبّق قواعد تتطلب كلاً من وكيل المستخدم الصحيح ونطاق IP المُتحقق منه. يمنع هذا الانتحال مع السماح ببرامج الزحف المشروعة.
ما هي حدود المعدل المناسبة لبرامج زحف الذكاء الاصطناعي؟
تحترم برامج زحف الذكاء الاصطناعي المشروعة عادةً حدود المعدل المعقولة وتوجيهات تأخير الزحف. بالنسبة لبرامج الزحف المفيدة مثل PerplexityBot و GPTBot، استثنها من تحديد المعدل تمامًا أو اضبط حدودًا سخية جدًا (1000+ طلب لكل 5 دقائق). تم تصميم برامج الزحف هذه بالفعل لتكون محترمة ولن تُثقل خادمك. بالنسبة لبرامج زحف SEO العدوانية مثل AhrefsBot أو SemrushBot، طبّق حدودًا صارمة (10-20 طلبًا في الدقيقة) لمنع استنزاف الموارد. راقب حمل الخادم واضبط الحدود بناءً على سعة بنيتك التحتية. يجب أن تكون لنقاط نهاية API حدود أكثر صرامة من صفحات المحتوى.
هل يجب عليّ حظر جميع معرّفات وكيل المستخدم Python و curl؟
يمكن أن يكون حظر معرّفات وكيل المستخدم العامة مثل "python-requests" أو "curl" فعالاً ضد أدوات الاستخراج غير المتطورة، ولكنه قد يحظر أيضًا الأدوات الآلية المشروعة وخدمات المراقبة والنصوص الداخلية. بدلاً من الحظر الشامل، استخدم نهجًا متعدد الطبقات: احظر معرّفات وكيل المستخدم هذه فقط على نقاط النهاية الحساسة (واجهات API، لوحات الإدارة) مع السماح بها على المحتوى العام. بدلاً من ذلك، استخدم تحديد المعدل بدلاً من الحظر الكامل—ستحترم الأدوات المشروعة حدود المعدل بينما ستؤدي أدوات الاستخراج العدوانية إلى تفعيل الحظر. فكر في تطبيق مصادقة مفتاح API للوصول البرمجي بدلاً من الاعتماد فقط على حظر وكيل المستخدم.
كيف أتعامل مع النتائج الإيجابية الخاطئة حيث يتم حظر المستخدمين المشروعين؟
النتائج الإيجابية الخاطئة أمر لا مفر منه مع إدارة الروبوتات العدوانية. طبّق عملية إلغاء حظر واضحة: أنشئ صفحة مخصصة تشرح سبب حدوث الحظر وتوفر معلومات الاتصال للمستخدمين المشروعين لطلب إلغاء الحظر. استخدم "التحدي المُدار" بدلاً من "الحظر" للحالات الحدية، حيث يسمح هذا للمستخدمين المشروعين بإثبات أنهم بشر. راقب لوحة معلومات أحداث الأمان يوميًا للكشف عن الأنماط التي تشير إلى نتائج إيجابية خاطئة (مثل الحظر من نطاقات IP للشركات، أو مناطق جغرافية محددة، أو خلال ساعات العمل). احتفظ بقائمة بيضاء لنطاقات IP الجيدة المعروفة (مكتبك، شبكات الشركات الكبرى، موفري السحابة المستخدمين من قبل الخدمات المشروعة).
ما هو تأثير قواعد WAF هذه على فاتورة Cloudflare الخاصة بي؟
تُدرج القواعد المخصصة لـ WAF في خطط Cloudflare Pro وما فوق، مع حدود على عدد القواعد التي يمكنك إنشاؤها (عادةً 10-100 حسب خطتك). القواعد نفسها لا تتحمل رسومًا لكل طلب—يتم تقييمها كجزء من معالجة الطلبات القياسية في Cloudflare. قد يكون لقواعد تحديد المعدل تسعير منفصل في بعض الخطط. تتطلب ميزات إدارة الروبوتات (cf.bot_management.score) خطة Business أو Enterprise. تأثير الأداء ضئيل حيث تعالج شبكة Cloudflare الحدية هذه القواعد بكفاءة. عادةً ما تفوق وفورات التكلفة من حظر حركة المرور الضارة (تقليل النطاق الترددي، وحمل الخادم، والتكاليف المتعلقة بالاستخراج) أي رسوم إضافية من Cloudflare.
كيف أوازن بين وصول برامج زحف SEO وحماية أدوات الاستخراج؟
ميّز بين برامج زحف SEO المشروعة (Googlebot و Bingbot) وأدوات SEO العدوانية (AhrefsBot و SemrushBot). اسمح دائمًا ببرامج زحف محركات البحث المُتحقق منها—استخدم cf.bot_management.verified_bot للتأكد من أنها مشروعة. بالنسبة لبرامج زحف أدوات SEO، طبّق تحديد المعدل بدلاً من الحظر إذا وجدت بياناتها مفيدة للتحليل التنافسي. استخدم توجيهات تأخير الزحف في robots.txt لإبطاء برامج الزحف العدوانية دون حظرها تمامًا. بالنسبة للمحتوى المميز أو المحمي، احظر جميع برامج الزحف باستثناء محركات البحث المُتحقق منها. تذكر أن برامج زحف محركات البحث المشروعة (Google و Bing) ضرورية لـ SEO التقليدي، بينما برامج زحف البحث بالذكاء الاصطناعي (Perplexity و ChatGPT) ضرورية لظهور البحث بالذكاء الاصطناعي—أنت بحاجة إلى كليهما.
هل يمكنني استخدام هذه القواعد لإنشاء نموذج وصول API مدفوع؟
نعم، يمكن لقواعد WAF فرض نموذج وصول متدرج. أنشئ قواعد تحظر جميع الوصول الآلي إلى نقاط نهاية محددة، ثم أصدر مفاتيح API للعملاء الذين يدفعون وأضف نطاقات IP الخاصة بهم إلى القائمة البيضاء أو اطلب رؤوس مصادقة. استخدم Cloudflare Workers بالاشتراك مع قواعد WAF لمصادقة أكثر تطورًا. طبّق مستويات تحديد معدل بناءً على مستوى الاشتراك—المستوى المجاني يحصل على 100 طلب/ساعة، المستوى المدفوع يحصل على 10,000 طلب/ساعة. بالنسبة لشركات الذكاء الاصطناعي التي تريد التدريب على محتواك، يمكنك السماح بشكل انتقائي لبرامج الزحف الخاصة بها بأقسام محددة مع طلب اتفاقيات تجارية للمحتوى المميز. هذا النهج أصبح شائعًا بشكل متزايد حيث يسعى الناشرون إلى تحقيق الدخل من الوصول إلى بيانات تدريب الذكاء الاصطناعي.
ماذا يجب أن أفعل إذا تم إطلاق محرك بحث ذكاء اصطناعي جديد؟
عند إطلاق محرك بحث ذكاء اصطناعي جديد، ابحث في وثائق برنامج الزحف الخاص به لتحديد سلسلة وكيل المستخدم ونطاقات IP. تنشر معظم شركات الذكاء الاصطناعي المشروعة هذه المعلومات في وثائق robots.txt أو صفحات المطورين. أضف وكيل المستخدم الخاص بهم إلى قائمة السماح الخاصة بك في غضون 24-48 ساعة من الإطلاق لضمان فهرسة محتواك مبكرًا. راقب أحداث الأمان لمعرفة ما إذا كان برنامج الزحف الخاص بهم يتم حظره بواسطة القواعد الحالية. ضع في اعتبارك سمعة الشركة وقيمة حركة المرور المحتملة قبل السماح ببرنامج الزحف الخاص بهم—ليست جميع محركات البحث بالذكاء الاصطناعي ستجلب حركة مرور ذات مغزى. انضم إلى مجتمعات ومنتديات مشرفي المواقع حيث تتم مناقشة إطلاقات برامج الزحف الجديدة للبقاء على اطلاع بالمنصات الناشئة.