Como Configurar Regras WAF do Cloudflare para Permitir Perplexity e ChatGPT Bloqueando Rastreadores Agressivos
Compreendendo o Gerenciamento de Bots de IA do Cloudflare: Por Que o Botão de Bloqueio Global É Perigoso
O recurso "Bloquear Bots de IA" com um clique do Cloudflare bloqueia indiscriminadamente todos os rastreadores de IA, incluindo mecanismos de busca benéficos como Perplexity e ChatGPT que geram tráfego orgânico significativo para o seu site. Esta opção nuclear impede que seu conteúdo seja indexado por plataformas de busca de IA de próxima geração, tornando efetivamente seu site invisível para milhões de usuários que dependem de ferramentas de busca alimentadas por IA para descoberta de informações.
A Importância Estratégica do Gerenciamento Seletivo de Bots de IA
O tráfego web moderno origina-se cada vez mais de mecanismos de busca e assistentes alimentados por IA. Perplexity, ChatGPT Search, AI Overviews do Google e plataformas similares representam o futuro da recuperação de informações. Bloquear esses rastreadores legítimos enquanto usa o bloqueio geral de bots de IA do Cloudflare cria uma lacuna crítica de visibilidade que pode impactar severamente a descoberta e o alcance orgânico do seu site.
A solução está em implementar regras granulares de Web Application Firewall (WAF) que distinguem entre rastreadores de IA benéficos e scrapers agressivos que consomem largura de banda sem fornecer valor. Este guia fornece instruções abrangentes para configurar regras WAF do Cloudflare que protegem sua infraestrutura enquanto mantêm a visibilidade em ecossistemas de busca de IA.
Principais User-Agents de Rastreadores de IA e Faixas de IP
Antes de configurar regras WAF, você deve entender os métodos de identificação usados por rastreadores de IA legítimos. A tabela a seguir fornece informações abrangentes sobre os principais user-agents de bots de IA e suas faixas de IP associadas:
| Provedor | Token User-Agent | Exemplo de User-Agent Completo | Verificação de Faixa de IP | Token Robots.txt |
|---|---|---|---|---|
| Perplexity AI | PerplexityBot | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; PerplexityBot/1.0; +https://perplexity.ai/bot) | Verificar via lookup de DNS reverso | PerplexityBot |
| OpenAI (ChatGPT) | GPTBot | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; GPTBot/1.0; +https://openai.com/gptbot) | JSON publicado em openai.com/gptbot.json | GPTBot |
| OpenAI (SearchGPT) | OAI-SearchBot | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; OAI-SearchBot/1.0; +https://openai.com/searchbot) | JSON publicado em openai.com/searchbot.json | OAI-SearchBot |
| Google (Gemini) | Google-Extended | Mozilla/5.0 (compatible; Google-Extended/1.0; +http://www.google.com/bot.html) | Verificar via faixas de IP do Google | Google-Extended |
| Anthropic (Claude) | anthropic-ai | anthropic-ai (compatible; Claude-Web/1.0; +https://anthropic.com/bot) | Verificar via DNS reverso | anthropic-ai |
| Apple (Applebot) | Applebot | Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/605.1.15 (KHTML, like Gecko) Version/17.4 Safari/605.1.15 (Applebot/0.1; +http://www.apple.com/go/applebot) | 17.0.0.0/8 (faixa principal) | Applebot |
| Cohere | cohere-ai | cohere-ai (compatible; CohereBot/1.0; +https://cohere.com/bot) | Verificar via DNS reverso | cohere-ai |
| Meta AI | FacebookBot | facebookexternalhit/1.1 (+http://www.facebook.com/externalhit_uatext.php) | ASN publicado: AS32934, AS63293 | FacebookBot |
Configurando Regras WAF Personalizadas para Permitir Rastreadores de IA Benéficos
As Regras Personalizadas WAF do Cloudflare fornecem a flexibilidade para criar políticas sofisticadas de gerenciamento de bots. A configuração a seguir permite rastreadores de busca de IA legítimos enquanto bloqueia scrapers agressivos e bots não autorizados.
Passo 1: Acessar Regras Personalizadas WAF do Cloudflare
- Faça login no seu painel do Cloudflare
- Selecione o domínio que deseja configurar
- Navegue até Security → WAF → Custom rules
- Clique em Create rule para começar a configurar seu conjunto de regras personalizado
Passo 2: Criar uma Regra de Permissão para Rastreadores de IA Legítimos
Crie uma regra com a seguinte configuração:
Nome da Regra: Allow Legitimate AI Search Crawlers
Expressão:
(http.user_agent contains "PerplexityBot") or (http.user_agent contains "GPTBot") or (http.user_agent contains "OAI-SearchBot") or (http.user_agent contains "Google-Extended") or (http.user_agent contains "anthropic-ai") or (http.user_agent contains "Applebot") or (http.user_agent contains "cohere-ai") or (http.user_agent contains "FacebookBot" and not http.user_agent contains "facebookexternalhit")
Ação: Allow
Prioridade: Defina como 1 (prioridade máxima para garantir que esta regra seja executada primeiro)
Passo 3: Criar uma Regra de Bloqueio para Scrapers Genéricos Agressivos
Após permitir rastreadores legítimos, crie uma regra secundária para bloquear scrapers agressivos conhecidos:
Nome da Regra: Block Aggressive Scrapers and Unauthorized Bots
Expressão:
(http.user_agent contains "scrapy") or (http.user_agent contains "python-requests") or (http.user_agent contains "curl") or (http.user_agent contains "wget") or (http.user_agent contains "go-http-client") or (http.user_agent contains "axios") or (http.user_agent contains "node-fetch") or (http.user_agent eq "") or (http.user_agent contains "Bytespider") or (http.user_agent contains "PetalBot") or (http.user_agent contains "AhrefsBot" and not cf.bot_management.verified_bot) or (http.user_agent contains "SemrushBot" and not cf.bot_management.verified_bot) or (http.user_agent contains "DotBot") or (http.user_agent contains "MJ12bot") or (http.user_agent contains "BLEXBot")
Ação: Block
Prioridade: Defina como 2
Passo 4: Implementar Regras de Desafio para Padrões de Tráfego Suspeitos
Para tráfego que não corresponde aos critérios de permissão ou bloqueio, mas exibe padrões suspeitos, implemente uma regra de desafio:
Nome da Regra: Challenge Suspicious Bot-Like Behavior
Expressão:
(cf.bot_management.score lt 30) and not (cf.bot_management.verified_bot) and not (http.user_agent contains "PerplexityBot") and not (http.user_agent contains "GPTBot") and not (http.user_agent contains "OAI-SearchBot") and not (http.user_agent contains "Google-Extended") and not (http.user_agent contains "Applebot")
Ação: Managed Challenge
Prioridade: Defina como 3
Implementando Regras de Limitação de Taxa Personalizadas para Proteção de Endpoints de API
A limitação de taxa fornece uma camada adicional de proteção contra abuso de scraping, particularmente para endpoints de API e páginas que consomem muitos recursos. Siga estes passos para configurar limitação de taxa inteligente que não impacta rastreadores de IA legítimos:
Passo 1: Navegar até Regras de Limitação de Taxa
- No seu painel do Cloudflare, vá para Security → WAF → Rate limiting rules
- Clique em Create rule
Passo 2: Configurar Limitação de Taxa para Endpoints de API
Nome da Regra: API Endpoint Rate Limiting with AI Crawler Exemption
Expressão:
(http.request.uri.path contains "/api/") and not (http.user_agent contains "PerplexityBot") and not (http.user_agent contains "GPTBot") and not (http.user_agent contains "OAI-SearchBot") and not (http.user_agent contains "Applebot") and not (cf.bot_management.verified_bot)
Características:
- Requisições: 100 requisições
- Período: 60 segundos
- Método de contagem: Contar por endereço IP
Ação: Bloquear por 1 hora
Passo 3: Configurar Limitação de Taxa para Páginas de Conteúdo
Para páginas de conteúdo, implemente limites de taxa mais generosos que acomodem padrões legítimos de leitura:
Nome da Regra: Content Page Rate Limiting
Expressão:
(http.request.uri.path contains "/blog/" or http.request.uri.path contains "/articles/") and not (http.user_agent contains "PerplexityBot") and not (http.user_agent contains "GPTBot") and not (http.user_agent contains "OAI-SearchBot") and not (http.user_agent contains "Google-Extended") and not (http.user_agent contains "Applebot") and not (cf.bot_management.verified_bot)
Características:
- Requisições: 300 requisições
- Período: 300 segundos (5 minutos)
- Método de contagem: Contar por endereço IP
Ação: Managed Challenge
Passo 4: Implementar Limitação de Taxa para Rastreadores Agressivos
Crie um limite de taxa estrito especificamente para rastreadores agressivos conhecidos que não foram bloqueados completamente:
Nome da Regra: Aggressive Crawler Throttling
Expressão:
(http.user_agent contains "AhrefsBot") or (http.user_agent contains "SemrushBot") or (http.user_agent contains "MJ12bot") or (cf.bot_management.score lt 20 and not cf.bot_management.verified_bot)
Características:
- Requisições: 10 requisições
- Período: 60 segundos
- Método de contagem: Contar por endereço IP
Ação: Bloquear por 24 horas
Passo 5: Monitorar e Ajustar Limites de Taxa
- Navegue até Security → Events para monitorar regras acionadas
- Revise o Activity log para falsos positivos afetando tráfego legítimo
- Ajuste os limites de taxa com base nos padrões típicos de tráfego do seu site
- Use Analytics → Security para identificar padrões emergentes de scrapers
- Atualize sua lista de permissões trimestralmente conforme novos mecanismos de busca de IA surgem
Configuração Avançada: Verificação de Faixa de IP
Strings de user-agent podem ser falsificadas, tornando a verificação de faixa de IP um método essencial de validação secundária. Implemente estas regras avançadas para segurança aprimorada:
Validação de Faixa de IP de Bot Verificado
Crie uma regra que exija tanto user-agent correto QUANTO verificação de faixa de IP para conteúdo de alto valor:
(http.request.uri.path contains "/premium/") and ( (http.user_agent contains "GPTBot" and not cf.bot_management.verified_bot) or (http.user_agent contains "PerplexityBot" and not cf.bot_management.verified_bot) )
Ação: Managed Challenge
Esta regra desafia rastreadores que alegam ser bots de IA legítimos mas não se originam de faixas de IP verificadas, protegendo conteúdo premium de tentativas de falsificação.
Melhores Práticas de Monitoramento e Manutenção
O gerenciamento eficaz de regras WAF requer monitoramento e ajuste contínuos. Implemente estas melhores práticas:
- Revisão Semanal: Verifique Eventos de Segurança para tráfego legítimo bloqueado e ajuste as regras adequadamente
- Análise Mensal: Revise dados de Analytics para identificar novos user-agents de rastreadores e padrões emergentes de scraping
- Atualizações Trimestrais: Atualize sua lista de permissões conforme novos mecanismos de busca de IA são lançados e os existentes modificam seus rastreadores
- Configuração de Alertas: Configure notificações do Cloudflare para picos incomuns em tráfego bloqueado
- Documentação: Mantenha documentação interna de mudanças de regras e a justificativa por trás de cada configuração
- Protocolo de Teste: Antes de implantar novas regras em produção, teste-as no modo "Log" para identificar problemas potenciais
Coordenação com Robots.txt
As regras WAF devem complementar, não substituir, suas diretivas robots.txt. Mantenha uma abordagem coordenada:
# Permitir rastreadores de IA benéficos User-agent: PerplexityBot Allow: / User-agent: GPTBot Allow: / User-agent: OAI-SearchBot Allow: / User-agent: Google-Extended Allow: / User-agent: Applebot Allow: / User-agent: anthropic-ai Allow: / # Bloquear scrapers agressivos User-agent: Bytespider Disallow: / User-agent: PetalBot Disallow: / User-agent: AhrefsBot Crawl-delay: 10 Disallow: /api/ User-agent: SemrushBot Crawl-delay: 10 Disallow: /api/
Considerações sobre Impacto no Desempenho
As regras WAF são executadas em cada requisição, portanto a otimização é crucial para manter o desempenho do site:
- Ordem das Regras: Coloque regras correspondidas com mais frequência (regras de permissão para rastreadores comuns) em prioridade mais alta para reduzir o tempo de processamento
- Eficiência de Expressão: Use correspondência de string simples (contains) em vez de regex complexo quando possível
- Consolidação de Regras: Combine condições relacionadas em regras únicas em vez de criar múltiplas regras sobrepostas
- Integração com Cache: Garanta que as regras WAF não interfiram com o cache do Cloudflare evitando desafios desnecessários em recursos cacheáveis
- Considerações Geográficas: Para conteúdo específico de região, adicione filtros geográficos para reduzir avaliação desnecessária de regras
Perguntas Frequentes
Por que não devo usar o recurso "Bloquear Bots de IA" com um clique do Cloudflare?
O bloqueio global de bots de IA do Cloudflare é uma ferramenta indiscriminada que bloqueia todos os rastreadores de IA, incluindo os benéficos como Perplexity, ChatGPT Search e recursos de IA do Google. Essas plataformas geram tráfego orgânico significativo e representam o futuro da busca. Bloqueá-las torna seu conteúdo invisível para milhões de usuários que dependem de ferramentas de busca alimentadas por IA. Regras WAF personalizadas permitem que você permita seletivamente mecanismos de busca de IA legítimos enquanto bloqueia scrapers agressivos que não fornecem valor.
Como verifico se minhas regras WAF estão funcionando corretamente?
Monitore suas regras através do painel de Eventos de Segurança do Cloudflare (Security → Events). Isso mostra dados em tempo real sobre quais regras estão sendo acionadas e qual tráfego elas estão afetando. Inicie novas regras no modo "Log" em vez do modo "Block" para observar seu comportamento sem impactar o tráfego. Revise o Activity log diariamente durante a primeira semana após implementar novas regras para detectar falsos positivos. Você também pode usar comandos curl com diferentes strings de user-agent para testar suas regras manualmente.
Qual é a diferença entre as ações "Block" e "Managed Challenge"?
"Block" nega acesso imediatamente sem oportunidade para o visitante prosseguir, retornando um erro 403 Forbidden. Isso é apropriado para bots maliciosos conhecidos e scrapers agressivos. "Managed Challenge" apresenta um desafio inteligente que navegadores legítimos podem passar automaticamente enquanto bloqueia bots. O sistema do Cloudflare determina o tipo de desafio apropriado (invisível, desafio JavaScript ou CAPTCHA) com base nas características da requisição. Use Managed Challenge para tráfego suspeito que pode incluir usuários legítimos, e Block para fontes maliciosas confirmadas.
Com que frequência devo atualizar minha lista de permissões de rastreadores de IA?
Revise e atualize sua lista de permissões trimestralmente no mínimo, pois o cenário de busca de IA evolui rapidamente. Novos mecanismos de busca de IA são lançados regularmente, e os existentes podem mudar seus user-agents de rastreador ou faixas de IP. Inscreva-se em anúncios de grandes empresas de IA (OpenAI, Anthropic, Google, Perplexity) para se manter informado sobre mudanças de rastreadores. Monitore seu log de Eventos de Segurança para user-agents bloqueados que possam ser novos rastreadores legítimos. Quando produtos importantes de busca de IA são lançados (como ChatGPT Search ou novos recursos de IA do Google), atualize suas regras imediatamente para manter a visibilidade.
Rastreadores de IA legítimos podem falsificar seus user-agents para contornar minhas regras?
Embora user-agents possam ser falsificados, empresas de IA legítimas não se envolvem nessa prática, pois isso prejudicaria sua reputação e violaria diretrizes para webmasters. No entanto, atores maliciosos podem falsificar user-agents de rastreadores legítimos. É por isso que a verificação de faixa de IP é crucial. Use o campo cf.bot_management.verified_bot do Cloudflare, que valida que requisições alegando ser de bots conhecidos realmente se originam de faixas de IP verificadas. Para conteúdo de alto valor, implemente regras que exijam tanto user-agent correto QUANTO faixa de IP verificada. Isso previne falsificação enquanto permite rastreadores legítimos.
Quais limites de taxa são apropriados para rastreadores de IA?
Rastreadores de IA legítimos tipicamente respeitam limites de taxa razoáveis e diretivas crawl-delay. Para rastreadores benéficos como PerplexityBot e GPTBot, isente-os completamente da limitação de taxa ou defina limites muito generosos (1000+ requisições por 5 minutos). Esses rastreadores já são projetados para serem respeitosos e não sobrecarregarão seu servidor. Para rastreadores de SEO agressivos como AhrefsBot ou SemrushBot, implemente limites estritos (10-20 requisições por minuto) para prevenir esgotamento de recursos. Monitore a carga do seu servidor e ajuste os limites com base na capacidade da sua infraestrutura. Endpoints de API devem ter limites mais estritos do que páginas de conteúdo.
Devo bloquear todos os user-agents Python e curl?
Bloquear user-agents genéricos como "python-requests" ou "curl" pode ser eficaz contra scrapers não sofisticados, mas também pode bloquear ferramentas automatizadas legítimas, serviços de monitoramento e scripts internos. Em vez de bloqueio geral, use uma abordagem em camadas: bloqueie esses user-agents apenas em endpoints sensíveis (APIs, painéis administrativos) enquanto os permite em conteúdo público. Alternativamente, use limitação de taxa em vez de bloqueio total—ferramentas legítimas respeitarão limites de taxa enquanto scrapers agressivos acionarão bloqueios. Considere implementar autenticação por chave de API para acesso programático em vez de depender apenas de bloqueio de user-agent.
Como lidar com falsos positivos onde usuários legítimos são bloqueados?
Falsos positivos são inevitáveis com gerenciamento agressivo de bots. Implemente um processo claro de desbloqueio: crie uma página dedicada explicando por que o bloqueio ocorreu e fornecendo informações de contato para usuários legítimos solicitarem desbloqueio. Use "Managed Challenge" em vez de "Block" para casos limítrofes, pois isso permite que usuários legítimos provem que são humanos. Monitore seu painel de Eventos de Segurança diariamente para padrões indicando falsos positivos (por exemplo, bloqueios de faixas de IP corporativas, regiões geográficas específicas ou durante horário comercial). Mantenha uma lista de permissões de faixas de IP conhecidas como boas (seu escritório, grandes redes corporativas, provedores de nuvem usados por serviços legítimos).
Qual é o impacto dessas regras WAF na minha conta do Cloudflare?
Regras Personalizadas WAF estão incluídas nos planos Pro e superiores do Cloudflare, com limites no número de regras que você pode criar (tipicamente 10-100 dependendo do seu plano). As regras em si não incorrem em cobranças por requisição—elas são avaliadas como parte do processamento padrão de requisições do Cloudflare. Regras de Limitação de Taxa podem ter preços separados em alguns planos. Recursos de Gerenciamento de Bots (cf.bot_management.score) requerem um plano Business ou Enterprise. O impacto no desempenho é mínimo, pois a rede de borda do Cloudflare processa essas regras eficientemente. A economia de custos ao bloquear tráfego malicioso (largura de banda reduzida, carga do servidor e custos relacionados a scraping) tipicamente supera em muito quaisquer taxas adicionais do Cloudflare.
Como equilibrar acesso de rastreadores de SEO com proteção contra scrapers?
Distinga entre rastreadores de SEO legítimos (Googlebot, Bingbot) e ferramentas de SEO agressivas (AhrefsBot, SemrushBot). Sempre permita rastreadores de mecanismos de busca verificados—use cf.bot_management.verified_bot para garantir que sejam legítimos. Para rastreadores de ferramentas de SEO, implemente limitação de taxa em vez de bloqueio se você achar seus dados úteis para análise competitiva. Use diretivas crawl-delay do robots.txt para desacelerar rastreadores agressivos sem bloqueá-los completamente. Para conteúdo premium ou restrito, bloqueie todos os rastreadores exceto mecanismos de busca verificados. Lembre-se de que rastreadores de mecanismos de busca legítimos (Google, Bing) são essenciais para SEO tradicional, enquanto rastreadores de busca de IA (Perplexity, ChatGPT) são essenciais para visibilidade em busca de IA—você precisa de ambos.
Posso usar essas regras para criar um modelo de acesso pago à API?
Sim, regras WAF podem impor um modelo de acesso em camadas. Crie regras que bloqueiem todo acesso automatizado a endpoints específicos, então emita chaves de API para clientes pagantes e coloque suas faixas de IP na lista de permissões ou exija cabeçalhos de autenticação. Use Cloudflare Workers em combinação com regras WAF para autenticação mais sofisticada. Implemente camadas de limitação de taxa baseadas no nível de assinatura—camada gratuita recebe 100 requisições/hora, camada paga recebe 10.000 requisições/hora. Para empresas de IA querendo treinar com seu conteúdo, você pode permitir seletivamente seus rastreadores em seções específicas enquanto exige acordos comerciais para conteúdo premium. Essa abordagem é cada vez mais comum conforme editores buscam monetizar o acesso a dados de treinamento de IA.
O que devo fazer se um novo mecanismo de busca de IA for lançado?
Quando um novo mecanismo de busca de IA for lançado, pesquise a documentação do rastreador deles para identificar sua string de user-agent e faixas de IP. A maioria das empresas de IA legítimas publica essas informações em sua documentação robots.txt ou páginas de desenvolvedor. Adicione seu user-agent à sua lista de permissões dentro de 24-48 horas do lançamento para garantir que seu conteúdo seja indexado cedo. Monitore Eventos de Segurança para ver se o rastreador deles está sendo bloqueado por regras existentes. Considere a reputação da empresa e o valor potencial de tráfego antes de permitir seu rastreador—nem todos os mecanismos de busca de IA gerarão tráfego significativo. Participe de comunidades e fóruns de webmasters onde lançamentos de novos rastreadores são discutidos para se manter informado sobre plataformas emergentes.