Methodology v1.0
July 18, 2026 • By AICompatible Team • 8 min read

Comment configurer les règles WAF Cloudflare pour autoriser Perplexity et ChatGPT tout en bloquant les robots d'indexation agressifs

Comprendre la gestion des robots IA de Cloudflare : pourquoi le bouton de blocage global est dangereux

La fonctionnalité « Bloquer les robots IA » en un clic de Cloudflare bloque indistinctement tous les robots d'indexation IA, y compris les moteurs de recherche bénéfiques comme Perplexity et ChatGPT qui génèrent un trafic organique significatif vers votre site. Cette option radicale empêche votre contenu d'être indexé par les plateformes de recherche IA de nouvelle génération, rendant effectivement votre site web invisible à des millions d'utilisateurs qui s'appuient sur les outils de recherche alimentés par l'IA pour découvrir des informations.

L'importance stratégique d'une gestion sélective des robots IA

Le trafic web moderne provient de plus en plus de moteurs de recherche et d'assistants alimentés par l'IA. Perplexity, ChatGPT Search, les aperçus IA de Google et les plateformes similaires représentent l'avenir de la recherche d'information. Bloquer ces robots d'indexation légitimes tout en utilisant le blocage global des robots IA de Cloudflare crée un déficit de visibilité critique qui peut gravement impacter la découvrabilité de votre site et sa portée organique.

La solution réside dans la mise en œuvre de règles granulaires de pare-feu applicatif web (WAF) qui distinguent les robots d'indexation IA bénéfiques des extracteurs agressifs qui consomment de la bande passante sans apporter de valeur. Ce guide fournit des instructions complètes pour configurer des règles WAF Cloudflare qui protègent votre infrastructure tout en maintenant la visibilité dans les écosystèmes de recherche IA.

Principaux agents utilisateurs et plages IP des robots d'indexation IA

Avant de configurer les règles WAF, vous devez comprendre les méthodes d'identification utilisées par les robots d'indexation IA légitimes. Le tableau suivant fournit des informations complètes sur les principaux agents utilisateurs de robots IA et leurs plages IP associées :

Fournisseur Identifiant User-Agent Exemple de User-Agent complet Vérification de plage IP Identifiant Robots.txt
Perplexity AI PerplexityBot Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; PerplexityBot/1.0; +https://perplexity.ai/bot) Vérifier via recherche DNS inversée PerplexityBot
OpenAI (ChatGPT) GPTBot Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; GPTBot/1.0; +https://openai.com/gptbot) JSON publié sur openai.com/gptbot.json GPTBot
OpenAI (SearchGPT) OAI-SearchBot Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; OAI-SearchBot/1.0; +https://openai.com/searchbot) JSON publié sur openai.com/searchbot.json OAI-SearchBot
Google (Gemini) Google-Extended Mozilla/5.0 (compatible; Google-Extended/1.0; +http://www.google.com/bot.html) Vérifier via les plages IP Google Google-Extended
Anthropic (Claude) anthropic-ai anthropic-ai (compatible; Claude-Web/1.0; +https://anthropic.com/bot) Vérifier via DNS inversé anthropic-ai
Apple (Applebot) Applebot Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/605.1.15 (KHTML, like Gecko) Version/17.4 Safari/605.1.15 (Applebot/0.1; +http://www.apple.com/go/applebot) 17.0.0.0/8 (plage principale) Applebot
Cohere cohere-ai cohere-ai (compatible; CohereBot/1.0; +https://cohere.com/bot) Vérifier via DNS inversé cohere-ai
Meta AI FacebookBot facebookexternalhit/1.1 (+http://www.facebook.com/externalhit_uatext.php) ASN publié : AS32934, AS63293 FacebookBot

Configuration de règles WAF personnalisées pour autoriser les robots d'indexation IA bénéfiques

Les règles personnalisées WAF de Cloudflare offrent la flexibilité nécessaire pour créer des politiques sophistiquées de gestion des robots. La configuration suivante autorise les robots d'indexation de recherche IA légitimes tout en bloquant les extracteurs agressifs et les robots non autorisés.

Étape 1 : Accéder aux règles personnalisées WAF de Cloudflare

  1. Connectez-vous à votre tableau de bord Cloudflare
  2. Sélectionnez le domaine que vous souhaitez configurer
  3. Accédez à SécuritéWAFRègles personnalisées
  4. Cliquez sur Créer une règle pour commencer à configurer votre ensemble de règles personnalisé

Étape 2 : Créer une règle d'autorisation pour les robots d'indexation IA légitimes

Créez une règle avec la configuration suivante :

Nom de la règle : Autoriser les robots d'indexation de recherche IA légitimes

Expression :

(http.user_agent contains "PerplexityBot") or
(http.user_agent contains "GPTBot") or
(http.user_agent contains "OAI-SearchBot") or
(http.user_agent contains "Google-Extended") or
(http.user_agent contains "anthropic-ai") or
(http.user_agent contains "Applebot") or
(http.user_agent contains "cohere-ai") or
(http.user_agent contains "FacebookBot" and not http.user_agent contains "facebookexternalhit")

Action : Autoriser

Priorité : Définir à 1 (priorité la plus élevée pour garantir que cette règle s'exécute en premier)

Étape 3 : Créer une règle de blocage pour les extracteurs génériques agressifs

Après avoir autorisé les robots d'indexation légitimes, créez une règle secondaire pour bloquer les extracteurs agressifs connus :

Nom de la règle : Bloquer les extracteurs agressifs et les robots non autorisés

Expression :

(http.user_agent contains "scrapy") or
(http.user_agent contains "python-requests") or
(http.user_agent contains "curl") or
(http.user_agent contains "wget") or
(http.user_agent contains "go-http-client") or
(http.user_agent contains "axios") or
(http.user_agent contains "node-fetch") or
(http.user_agent eq "") or
(http.user_agent contains "Bytespider") or
(http.user_agent contains "PetalBot") or
(http.user_agent contains "AhrefsBot" and not cf.bot_management.verified_bot) or
(http.user_agent contains "SemrushBot" and not cf.bot_management.verified_bot) or
(http.user_agent contains "DotBot") or
(http.user_agent contains "MJ12bot") or
(http.user_agent contains "BLEXBot")

Action : Bloquer

Priorité : Définir à 2

Étape 4 : Mettre en œuvre des règles de défi pour les schémas de trafic suspects

Pour le trafic qui ne correspond ni aux critères d'autorisation ni de blocage mais présente des schémas suspects, mettez en œuvre une règle de défi :

Nom de la règle : Défier les comportements suspects de type robot

Expression :

(cf.bot_management.score lt 30) and
not (cf.bot_management.verified_bot) and
not (http.user_agent contains "PerplexityBot") and
not (http.user_agent contains "GPTBot") and
not (http.user_agent contains "OAI-SearchBot") and
not (http.user_agent contains "Google-Extended") and
not (http.user_agent contains "Applebot")

Action : Défi géré

Priorité : Définir à 3

Mise en œuvre de règles de limitation de débit personnalisées pour la protection des points de terminaison API

La limitation de débit fournit une couche de protection supplémentaire contre l'extraction abusive, particulièrement pour les points de terminaison API et les pages gourmandes en ressources. Suivez ces étapes pour configurer une limitation de débit intelligente qui n'impacte pas les robots d'indexation IA légitimes :

Étape 1 : Accéder aux règles de limitation de débit

  1. Dans votre tableau de bord Cloudflare, allez à SécuritéWAFRègles de limitation de débit
  2. Cliquez sur Créer une règle

Étape 2 : Configurer la limitation de débit des points de terminaison API

Nom de la règle : Limitation de débit des points de terminaison API avec exemption pour les robots d'indexation IA

Expression :

(http.request.uri.path contains "/api/") and
not (http.user_agent contains "PerplexityBot") and
not (http.user_agent contains "GPTBot") and
not (http.user_agent contains "OAI-SearchBot") and
not (http.user_agent contains "Applebot") and
not (cf.bot_management.verified_bot)

Caractéristiques :

  • Requêtes : 100 requêtes
  • Période : 60 secondes
  • Méthode de comptage : Compter par adresse IP

Action : Bloquer pendant 1 heure

Étape 3 : Configurer la limitation de débit des pages de contenu

Pour les pages de contenu, mettez en œuvre des limites de débit plus généreuses qui s'adaptent aux schémas de lecture légitimes :

Nom de la règle : Limitation de débit des pages de contenu

Expression :

(http.request.uri.path contains "/blog/" or http.request.uri.path contains "/articles/") and
not (http.user_agent contains "PerplexityBot") and
not (http.user_agent contains "GPTBot") and
not (http.user_agent contains "OAI-SearchBot") and
not (http.user_agent contains "Google-Extended") and
not (http.user_agent contains "Applebot") and
not (cf.bot_management.verified_bot)

Caractéristiques :

  • Requêtes : 300 requêtes
  • Période : 300 secondes (5 minutes)
  • Méthode de comptage : Compter par adresse IP

Action : Défi géré

Étape 4 : Mettre en œuvre la limitation de débit pour les robots d'indexation agressifs

Créez une limite de débit stricte spécifiquement pour les robots d'indexation agressifs connus qui n'ont pas été bloqués directement :

Nom de la règle : Limitation des robots d'indexation agressifs

Expression :

(http.user_agent contains "AhrefsBot") or
(http.user_agent contains "SemrushBot") or
(http.user_agent contains "MJ12bot") or
(cf.bot_management.score lt 20 and not cf.bot_management.verified_bot)

Caractéristiques :

  • Requêtes : 10 requêtes
  • Période : 60 secondes
  • Méthode de comptage : Compter par adresse IP

Action : Bloquer pendant 24 heures

Étape 5 : Surveiller et ajuster les limites de débit

  1. Accédez à SécuritéÉvénements pour surveiller les règles déclenchées
  2. Consultez le Journal d'activité pour détecter les faux positifs affectant le trafic légitime
  3. Ajustez les seuils de limitation de débit en fonction des schémas de trafic typiques de votre site
  4. Utilisez AnalytiqueSécurité pour identifier les schémas d'extraction émergents
  5. Mettez à jour votre liste d'autorisation trimestriellement à mesure que de nouveaux moteurs de recherche IA émergent

Configuration avancée : vérification des plages IP

Les chaînes d'agent utilisateur peuvent être usurpées, ce qui fait de la vérification des plages IP une méthode de validation secondaire essentielle. Mettez en œuvre ces règles avancées pour une sécurité renforcée :

Validation des plages IP de robots vérifiés

Créez une règle qui exige à la fois un agent utilisateur correct ET une vérification de plage IP pour le contenu à forte valeur ajoutée :

(http.request.uri.path contains "/premium/") and
(
  (http.user_agent contains "GPTBot" and not cf.bot_management.verified_bot) or
  (http.user_agent contains "PerplexityBot" and not cf.bot_management.verified_bot)
)

Action : Défi géré

Cette règle défie les robots d'indexation prétendant être des robots IA légitimes mais ne provenant pas de plages IP vérifiées, protégeant le contenu premium des tentatives d'usurpation.

Bonnes pratiques de surveillance et de maintenance

Une gestion efficace des règles WAF nécessite une surveillance et un ajustement continus. Mettez en œuvre ces bonnes pratiques :

  • Révision hebdomadaire : Vérifiez les événements de sécurité pour détecter le trafic légitime bloqué et ajustez les règles en conséquence
  • Analyse mensuelle : Examinez les données analytiques pour identifier les nouveaux agents utilisateurs de robots d'indexation et les schémas d'extraction émergents
  • Mises à jour trimestrielles : Actualisez votre liste d'autorisation à mesure que de nouveaux moteurs de recherche IA sont lancés et que les existants modifient leurs robots d'indexation
  • Configuration des alertes : Configurez les notifications Cloudflare pour les pics inhabituels de trafic bloqué
  • Documentation : Maintenez une documentation interne des modifications de règles et de la justification de chaque configuration
  • Protocole de test : Avant de déployer de nouvelles règles en production, testez-les en mode « Journal » pour identifier les problèmes potentiels

Coordination avec robots.txt

Les règles WAF doivent compléter, et non remplacer, vos directives robots.txt. Maintenez une approche coordonnée :

# Autoriser les robots d'indexation IA bénéfiques
User-agent: PerplexityBot
Allow: /

User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: Google-Extended
Allow: /

User-agent: Applebot
Allow: /

User-agent: anthropic-ai
Allow: /

# Bloquer les extracteurs agressifs
User-agent: Bytespider
Disallow: /

User-agent: PetalBot
Disallow: /

User-agent: AhrefsBot
Crawl-delay: 10
Disallow: /api/

User-agent: SemrushBot
Crawl-delay: 10
Disallow: /api/

Considérations relatives à l'impact sur les performances

Les règles WAF s'exécutent à chaque requête, l'optimisation est donc cruciale pour maintenir les performances du site :

  • Ordre des règles : Placez les règles les plus fréquemment correspondantes (règles d'autorisation pour les robots d'indexation courants) à une priorité plus élevée pour réduire le temps de traitement
  • Efficacité des expressions : Utilisez la correspondance de chaînes simple (contains) plutôt que des expressions régulières complexes lorsque c'est possible
  • Consolidation des règles : Combinez les conditions liées en règles uniques plutôt que de créer plusieurs règles qui se chevauchent
  • Intégration du cache : Assurez-vous que les règles WAF n'interfèrent pas avec la mise en cache de Cloudflare en évitant les défis inutiles sur les ressources pouvant être mises en cache
  • Considérations géographiques : Pour le contenu spécifique à une région, ajoutez des filtres géographiques pour réduire l'évaluation inutile des règles

Questions fréquemment posées

Pourquoi ne devrais-je pas utiliser la fonctionnalité « Bloquer les robots IA » en un clic de Cloudflare ?

Le blocage global des robots IA de Cloudflare est un outil indiscriminé qui bloque tous les robots d'indexation IA, y compris les bénéfiques comme Perplexity, ChatGPT Search et les fonctionnalités IA de Google. Ces plateformes génèrent un trafic organique significatif et représentent l'avenir de la recherche. Les bloquer rend votre contenu invisible à des millions d'utilisateurs qui s'appuient sur les outils de recherche alimentés par l'IA. Les règles WAF personnalisées vous permettent d'autoriser sélectivement les moteurs de recherche IA légitimes tout en bloquant les extracteurs agressifs qui n'apportent aucune valeur.

Comment vérifier que mes règles WAF fonctionnent correctement ?

Surveillez vos règles via le tableau de bord des événements de sécurité de Cloudflare (Sécurité → Événements). Cela affiche des données en temps réel sur les règles qui se déclenchent et le trafic qu'elles affectent. Commencez les nouvelles règles en mode « Journal » plutôt qu'en mode « Bloquer » pour observer leur comportement sans impacter le trafic. Consultez le journal d'activité quotidiennement pendant la première semaine après la mise en œuvre de nouvelles règles pour détecter les faux positifs. Vous pouvez également utiliser des commandes curl avec différentes chaînes d'agent utilisateur pour tester vos règles manuellement.

Quelle est la différence entre les actions « Bloquer » et « Défi géré » ?

« Bloquer » refuse immédiatement l'accès sans possibilité pour le visiteur de continuer, renvoyant une erreur 403 Interdit. Cela convient aux robots malveillants connus et aux extracteurs agressifs. « Défi géré » présente un défi intelligent que les navigateurs légitimes peuvent passer automatiquement tout en bloquant les robots. Le système de Cloudflare détermine le type de défi approprié (invisible, défi JavaScript ou CAPTCHA) en fonction des caractéristiques de la requête. Utilisez Défi géré pour le trafic suspect qui pourrait inclure des utilisateurs légitimes, et Bloquer pour les sources malveillantes confirmées.

À quelle fréquence dois-je mettre à jour ma liste d'autorisation de robots d'indexation IA ?

Révisez et mettez à jour votre liste d'autorisation au minimum trimestriellement, car le paysage de la recherche IA évolue rapidement. De nouveaux moteurs de recherche IA sont lancés régulièrement, et les existants peuvent modifier leurs agents utilisateurs de robots d'indexation ou leurs plages IP. Abonnez-vous aux annonces des grandes entreprises d'IA (OpenAI, Anthropic, Google, Perplexity) pour rester informé des changements de robots d'indexation. Surveillez votre journal des événements de sécurité pour détecter les agents utilisateurs bloqués qui pourraient être de nouveaux robots d'indexation légitimes. Lorsque de nouveaux produits de recherche IA majeurs sont lancés (comme ChatGPT Search ou de nouvelles fonctionnalités IA de Google), mettez à jour vos règles immédiatement pour maintenir la visibilité.

Les robots d'indexation IA légitimes peuvent-ils usurper leurs agents utilisateurs pour contourner mes règles ?

Bien que les agents utilisateurs puissent être usurpés, les entreprises d'IA légitimes ne se livrent pas à cette pratique car cela nuirait à leur réputation et violerait les directives pour les webmasters. Cependant, des acteurs malveillants peuvent usurper les agents utilisateurs de robots d'indexation légitimes. C'est pourquoi la vérification des plages IP est cruciale. Utilisez le champ cf.bot_management.verified_bot de Cloudflare, qui valide que les requêtes prétendant provenir de robots connus proviennent effectivement de plages IP vérifiées. Pour le contenu à forte valeur ajoutée, mettez en œuvre des règles qui exigent à la fois un agent utilisateur correct ET une plage IP vérifiée. Cela empêche l'usurpation tout en autorisant les robots d'indexation légitimes.

Quelles limites de débit sont appropriées pour les robots d'indexation IA ?

Les robots d'indexation IA légitimes respectent généralement les limites de débit raisonnables et les directives de délai d'indexation. Pour les robots d'indexation bénéfiques comme PerplexityBot et GPTBot, exemptez-les complètement de la limitation de débit ou définissez des limites très généreuses (1000+ requêtes par 5 minutes). Ces robots d'indexation sont déjà conçus pour être respectueux et ne submergeront pas votre serveur. Pour les robots d'indexation SEO agressifs comme AhrefsBot ou SemrushBot, mettez en œuvre des limites strictes (10-20 requêtes par minute) pour éviter l'épuisement des ressources. Surveillez la charge de votre serveur et ajustez les limites en fonction de la capacité de votre infrastructure. Les points de terminaison API devraient avoir des limites plus strictes que les pages de contenu.

Dois-je bloquer tous les agents utilisateurs Python et curl ?

Bloquer les agents utilisateurs génériques comme « python-requests » ou « curl » peut être efficace contre les extracteurs peu sophistiqués, mais peut également bloquer des outils automatisés légitimes, des services de surveillance et des scripts internes. Au lieu d'un blocage général, utilisez une approche en couches : bloquez ces agents utilisateurs uniquement sur les points de terminaison sensibles (API, panneaux d'administration) tout en les autorisant sur le contenu public. Alternativement, utilisez la limitation de débit plutôt que le blocage pur et simple—les outils légitimes respecteront les limites de débit tandis que les extracteurs agressifs déclencheront des blocages. Envisagez de mettre en œuvre une authentification par clé API pour l'accès programmatique plutôt que de vous fier uniquement au blocage d'agent utilisateur.

Comment gérer les faux positifs où des utilisateurs légitimes sont bloqués ?

Les faux positifs sont inévitables avec une gestion agressive des robots. Mettez en œuvre un processus de déblocage clair : créez une page dédiée expliquant pourquoi le blocage s'est produit et fournissant des informations de contact pour que les utilisateurs légitimes puissent demander un déblocage. Utilisez « Défi géré » au lieu de « Bloquer » pour les cas limites, car cela permet aux utilisateurs légitimes de prouver qu'ils sont humains. Surveillez quotidiennement votre tableau de bord des événements de sécurité pour détecter les schémas indiquant des faux positifs (par exemple, blocages depuis des plages IP d'entreprise, des régions géographiques spécifiques ou pendant les heures de bureau). Maintenez une liste blanche de plages IP connues comme bonnes (votre bureau, les grands réseaux d'entreprise, les fournisseurs cloud utilisés par des services légitimes).

Quel est l'impact de ces règles WAF sur ma facture Cloudflare ?

Les règles personnalisées WAF sont incluses dans les forfaits Cloudflare Pro et supérieurs, avec des limites sur le nombre de règles que vous pouvez créer (généralement 10-100 selon votre forfait). Les règles elles-mêmes n'entraînent pas de frais par requête—elles sont évaluées dans le cadre du traitement standard des requêtes de Cloudflare. Les règles de limitation de débit peuvent avoir une tarification distincte sur certains forfaits. Les fonctionnalités de gestion des robots (cf.bot_management.score) nécessitent un forfait Business ou Enterprise. L'impact sur les performances est minimal car le réseau périphérique de Cloudflare traite ces règles efficacement. Les économies de coûts résultant du blocage du trafic malveillant (bande passante réduite, charge serveur et coûts liés à l'extraction) dépassent généralement largement les frais Cloudflare supplémentaires.

Comment équilibrer l'accès des robots d'indexation SEO avec la protection contre les extracteurs ?

Distinguez les robots d'indexation SEO légitimes (Googlebot, Bingbot) des outils SEO agressifs (AhrefsBot, SemrushBot). Autorisez toujours les robots d'indexation de moteurs de recherche vérifiés—utilisez cf.bot_management.verified_bot pour vous assurer qu'ils sont légitimes. Pour les robots d'indexation d'outils SEO, mettez en œuvre une limitation de débit plutôt qu'un blocage si vous trouvez leurs données utiles pour l'analyse concurrentielle. Utilisez les directives de délai d'indexation robots.txt pour ralentir les robots d'indexation agressifs sans les bloquer entièrement. Pour le contenu premium ou restreint, bloquez tous les robots d'indexation sauf les moteurs de recherche vérifiés. N'oubliez pas que les robots d'indexation de moteurs de recherche légitimes (Google, Bing) sont essentiels pour le référencement traditionnel, tandis que les robots d'indexation de recherche IA (Perplexity, ChatGPT) sont essentiels pour la visibilité dans la recherche IA—vous avez besoin des deux.

Puis-je utiliser ces règles pour créer un modèle d'accès API payant ?

Oui, les règles WAF peuvent appliquer un modèle d'accès à plusieurs niveaux. Créez des règles qui bloquent tout accès automatisé à des points de terminaison spécifiques, puis émettez des clés API aux clients payants et mettez en liste blanche leurs plages IP ou exigez des en-têtes d'authentification. Utilisez Cloudflare Workers en combinaison avec les règles WAF pour une authentification plus sophistiquée. Mettez en œuvre des niveaux de limitation de débit basés sur le niveau d'abonnement—le niveau gratuit obtient 100 requêtes/heure, le niveau payant obtient 10 000 requêtes/heure. Pour les entreprises d'IA souhaitant s'entraîner sur votre contenu, vous pouvez autoriser sélectivement leurs robots d'indexation à des sections spécifiques tout en exigeant des accords commerciaux pour le contenu premium. Cette approche est de plus en plus courante alors que les éditeurs cherchent à monétiser l'accès aux données d'entraînement de l'IA.

Que dois-je faire si un nouveau moteur de recherche IA est lancé ?

Lorsqu'un nouveau moteur de recherche IA est lancé, recherchez la documentation de leur robot d'indexation pour identifier leur chaîne d'agent utilisateur et leurs plages IP. La plupart des entreprises d'IA légitimes publient ces informations dans leur documentation robots.txt ou leurs pages développeurs. Ajoutez leur agent utilisateur à votre liste d'autorisation dans les 24-48 heures suivant le lancement pour vous assurer que votre contenu est indexé tôt. Surveillez les événements de sécurité pour voir si leur robot d'indexation est bloqué par les règles existantes. Considérez la réputation de l'entreprise et la valeur potentielle du trafic avant d'autoriser leur robot d'indexation—tous les moteurs de recherche IA ne généreront pas un trafic significatif. Rejoignez les communautés et forums de webmasters où les lancements de nouveaux robots d'indexation sont discutés pour rester informé des plateformes émergentes.