So konfigurieren Sie Cloudflare WAF-Regeln, um Perplexity und ChatGPT zuzulassen und gleichzeitig aggressive Crawler zu blockieren
Cloudflares KI-Bot-Verwaltung verstehen: Warum die globale Blockier-Schaltfläche gefährlich ist
Cloudflares Ein-Klick-Funktion „KI-Bots blockieren" blockiert unterschiedslos alle KI-Crawler, einschließlich nützlicher Suchmaschinen wie Perplexity und ChatGPT, die erheblichen organischen Traffic auf Ihre Website bringen. Diese Radikallösung verhindert, dass Ihre Inhalte von KI-Suchplattformen der nächsten Generation indexiert werden, wodurch Ihre Website für Millionen von Nutzern unsichtbar wird, die auf KI-gestützte Suchwerkzeuge zur Informationsbeschaffung angewiesen sind.
Die strategische Bedeutung selektiver KI-Bot-Verwaltung
Moderner Web-Traffic stammt zunehmend von KI-gestützten Suchmaschinen und Assistenten. Perplexity, ChatGPT Search, Googles KI-Übersichten und ähnliche Plattformen repräsentieren die Zukunft der Informationsbeschaffung. Das Blockieren dieser legitimen Crawler bei gleichzeitiger Verwendung von Cloudflares pauschaler KI-Bot-Blockierung schafft eine kritische Sichtbarkeitslücke, die die Auffindbarkeit und organische Reichweite Ihrer Website erheblich beeinträchtigen kann.
Die Lösung liegt in der Implementierung granularer Web Application Firewall (WAF)-Regeln, die zwischen nützlichen KI-Crawlern und aggressiven Scrapern unterscheiden, die Bandbreite verbrauchen, ohne Mehrwert zu bieten. Dieser Leitfaden bietet umfassende Anweisungen zur Konfiguration von Cloudflare WAF-Regeln, die Ihre Infrastruktur schützen und gleichzeitig die Sichtbarkeit in KI-Such-Ökosystemen aufrechterhalten.
Wichtige KI-Crawler User-Agents und IP-Bereiche
Bevor Sie WAF-Regeln konfigurieren, müssen Sie die Identifikationsmethoden verstehen, die von legitimen KI-Crawlern verwendet werden. Die folgende Tabelle bietet umfassende Informationen über wichtige KI-Bot User-Agents und ihre zugehörigen IP-Bereiche:
| Anbieter | User-Agent-Token | Vollständiges User-Agent-Beispiel | IP-Bereichsverifizierung | Robots.txt-Token |
|---|---|---|---|---|
| Perplexity AI | PerplexityBot | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; PerplexityBot/1.0; +https://perplexity.ai/bot) | Verifizierung über Reverse-DNS-Lookup | PerplexityBot |
| OpenAI (ChatGPT) | GPTBot | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; GPTBot/1.0; +https://openai.com/gptbot) | Veröffentlichtes JSON unter openai.com/gptbot.json | GPTBot |
| OpenAI (SearchGPT) | OAI-SearchBot | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; OAI-SearchBot/1.0; +https://openai.com/searchbot) | Veröffentlichtes JSON unter openai.com/searchbot.json | OAI-SearchBot |
| Google (Gemini) | Google-Extended | Mozilla/5.0 (compatible; Google-Extended/1.0; +http://www.google.com/bot.html) | Verifizierung über Google-IP-Bereiche | Google-Extended |
| Anthropic (Claude) | anthropic-ai | anthropic-ai (compatible; Claude-Web/1.0; +https://anthropic.com/bot) | Verifizierung über Reverse-DNS | anthropic-ai |
| Apple (Applebot) | Applebot | Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/605.1.15 (KHTML, like Gecko) Version/17.4 Safari/605.1.15 (Applebot/0.1; +http://www.apple.com/go/applebot) | 17.0.0.0/8 (primärer Bereich) | Applebot |
| Cohere | cohere-ai | cohere-ai (compatible; CohereBot/1.0; +https://cohere.com/bot) | Verifizierung über Reverse-DNS | cohere-ai |
| Meta AI | FacebookBot | facebookexternalhit/1.1 (+http://www.facebook.com/externalhit_uatext.php) | Veröffentlichtes ASN: AS32934, AS63293 | FacebookBot |
Konfiguration benutzerdefinierter WAF-Regeln zur Zulassung nützlicher KI-Crawler
Cloudflares benutzerdefinierte WAF-Regeln bieten die Flexibilität, ausgefeilte Bot-Verwaltungsrichtlinien zu erstellen. Die folgende Konfiguration erlaubt legitime KI-Such-Crawler und blockiert gleichzeitig aggressive Scraper und nicht autorisierte Bots.
Schritt 1: Zugriff auf benutzerdefinierte Cloudflare WAF-Regeln
- Melden Sie sich in Ihrem Cloudflare-Dashboard an
- Wählen Sie die Domain aus, die Sie konfigurieren möchten
- Navigieren Sie zu Sicherheit → WAF → Benutzerdefinierte Regeln
- Klicken Sie auf Regel erstellen, um mit der Konfiguration Ihres benutzerdefinierten Regelwerks zu beginnen
Schritt 2: Erstellen Sie eine Zulassungsregel für legitime KI-Crawler
Erstellen Sie eine Regel mit der folgenden Konfiguration:
Regelname: Legitime KI-Such-Crawler zulassen
Ausdruck:
(http.user_agent contains "PerplexityBot") or (http.user_agent contains "GPTBot") or (http.user_agent contains "OAI-SearchBot") or (http.user_agent contains "Google-Extended") or (http.user_agent contains "anthropic-ai") or (http.user_agent contains "Applebot") or (http.user_agent contains "cohere-ai") or (http.user_agent contains "FacebookBot" and not http.user_agent contains "facebookexternalhit")
Aktion: Zulassen
Priorität: Auf 1 setzen (höchste Priorität, um sicherzustellen, dass diese Regel zuerst ausgeführt wird)
Schritt 3: Erstellen Sie eine Blockierregel für aggressive generische Scraper
Erstellen Sie nach der Zulassung legitimer Crawler eine sekundäre Regel, um bekannte aggressive Scraper zu blockieren:
Regelname: Aggressive Scraper und nicht autorisierte Bots blockieren
Ausdruck:
(http.user_agent contains "scrapy") or (http.user_agent contains "python-requests") or (http.user_agent contains "curl") or (http.user_agent contains "wget") or (http.user_agent contains "go-http-client") or (http.user_agent contains "axios") or (http.user_agent contains "node-fetch") or (http.user_agent eq "") or (http.user_agent contains "Bytespider") or (http.user_agent contains "PetalBot") or (http.user_agent contains "AhrefsBot" and not cf.bot_management.verified_bot) or (http.user_agent contains "SemrushBot" and not cf.bot_management.verified_bot) or (http.user_agent contains "DotBot") or (http.user_agent contains "MJ12bot") or (http.user_agent contains "BLEXBot")
Aktion: Blockieren
Priorität: Auf 2 setzen
Schritt 4: Implementieren Sie Challenge-Regeln für verdächtige Traffic-Muster
Für Traffic, der weder den Zulassungs- noch den Blockierkriterien entspricht, aber verdächtige Muster aufweist, implementieren Sie eine Challenge-Regel:
Regelname: Verdächtiges Bot-ähnliches Verhalten herausfordern
Ausdruck:
(cf.bot_management.score lt 30) and not (cf.bot_management.verified_bot) and not (http.user_agent contains "PerplexityBot") and not (http.user_agent contains "GPTBot") and not (http.user_agent contains "OAI-SearchBot") and not (http.user_agent contains "Google-Extended") and not (http.user_agent contains "Applebot")
Aktion: Verwaltete Herausforderung
Priorität: Auf 3 setzen
Implementierung benutzerdefinierter Rate-Limiting-Regeln zum Schutz von API-Endpunkten
Rate Limiting bietet eine zusätzliche Schutzebene gegen Scraping-Missbrauch, insbesondere für API-Endpunkte und ressourcenintensive Seiten. Befolgen Sie diese Schritte, um intelligentes Rate Limiting zu konfigurieren, das legitime KI-Crawler nicht beeinträchtigt:
Schritt 1: Navigieren Sie zu Rate-Limiting-Regeln
- Gehen Sie in Ihrem Cloudflare-Dashboard zu Sicherheit → WAF → Rate-Limiting-Regeln
- Klicken Sie auf Regel erstellen
Schritt 2: Konfigurieren Sie API-Endpunkt Rate Limiting
Regelname: API-Endpunkt Rate Limiting mit KI-Crawler-Ausnahme
Ausdruck:
(http.request.uri.path contains "/api/") and not (http.user_agent contains "PerplexityBot") and not (http.user_agent contains "GPTBot") and not (http.user_agent contains "OAI-SearchBot") and not (http.user_agent contains "Applebot") and not (cf.bot_management.verified_bot)
Merkmale:
- Anfragen: 100 Anfragen
- Zeitraum: 60 Sekunden
- Zählmethode: Nach IP-Adresse zählen
Aktion: Für 1 Stunde blockieren
Schritt 3: Konfigurieren Sie Content-Seiten Rate Limiting
Implementieren Sie für Content-Seiten großzügigere Rate Limits, die legitime Lesemuster berücksichtigen:
Regelname: Content-Seiten Rate Limiting
Ausdruck:
(http.request.uri.path contains "/blog/" or http.request.uri.path contains "/articles/") and not (http.user_agent contains "PerplexityBot") and not (http.user_agent contains "GPTBot") and not (http.user_agent contains "OAI-SearchBot") and not (http.user_agent contains "Google-Extended") and not (http.user_agent contains "Applebot") and not (cf.bot_management.verified_bot)
Merkmale:
- Anfragen: 300 Anfragen
- Zeitraum: 300 Sekunden (5 Minuten)
- Zählmethode: Nach IP-Adresse zählen
Aktion: Verwaltete Herausforderung
Schritt 4: Implementieren Sie aggressives Crawler Rate Limiting
Erstellen Sie ein striktes Rate Limit speziell für bekannte aggressive Crawler, die nicht vollständig blockiert wurden:
Regelname: Aggressive Crawler drosseln
Ausdruck:
(http.user_agent contains "AhrefsBot") or (http.user_agent contains "SemrushBot") or (http.user_agent contains "MJ12bot") or (cf.bot_management.score lt 20 and not cf.bot_management.verified_bot)
Merkmale:
- Anfragen: 10 Anfragen
- Zeitraum: 60 Sekunden
- Zählmethode: Nach IP-Adresse zählen
Aktion: Für 24 Stunden blockieren
Schritt 5: Überwachen und Anpassen von Rate Limits
- Navigieren Sie zu Sicherheit → Ereignisse, um ausgelöste Regeln zu überwachen
- Überprüfen Sie das Aktivitätsprotokoll auf Fehlalarme, die legitimen Traffic betreffen
- Passen Sie Rate-Limit-Schwellenwerte basierend auf den typischen Traffic-Mustern Ihrer Website an
- Verwenden Sie Analytics → Sicherheit, um aufkommende Scraper-Muster zu identifizieren
- Aktualisieren Sie Ihre Whitelist vierteljährlich, wenn neue KI-Suchmaschinen entstehen
Erweiterte Konfiguration: IP-Bereichsverifizierung
User-Agent-Strings können gefälscht werden, weshalb die IP-Bereichsverifizierung eine wesentliche sekundäre Validierungsmethode darstellt. Implementieren Sie diese erweiterten Regeln für erhöhte Sicherheit:
Validierung verifizierter Bot-IP-Bereiche
Erstellen Sie eine Regel, die sowohl korrekten User-Agent ALS AUCH IP-Bereichsverifizierung für hochwertige Inhalte erfordert:
(http.request.uri.path contains "/premium/") and ( (http.user_agent contains "GPTBot" and not cf.bot_management.verified_bot) or (http.user_agent contains "PerplexityBot" and not cf.bot_management.verified_bot) )
Aktion: Verwaltete Herausforderung
Diese Regel fordert Crawler heraus, die behaupten, legitime KI-Bots zu sein, aber nicht aus verifizierten IP-Bereichen stammen, und schützt Premium-Inhalte vor Spoofing-Versuchen.
Best Practices für Überwachung und Wartung
Effektives WAF-Regelmanagement erfordert kontinuierliche Überwachung und Anpassung. Implementieren Sie diese Best Practices:
- Wöchentliche Überprüfung: Prüfen Sie Sicherheitsereignisse auf blockierten legitimen Traffic und passen Sie Regeln entsprechend an
- Monatliche Analyse: Überprüfen Sie Analytics-Daten, um neue Crawler-User-Agents und aufkommende Scraping-Muster zu identifizieren
- Vierteljährliche Updates: Aktualisieren Sie Ihre Whitelist, wenn neue KI-Suchmaschinen starten und bestehende ihre Crawler modifizieren
- Alarm-Konfiguration: Richten Sie Cloudflare-Benachrichtigungen für ungewöhnliche Spitzen bei blockiertem Traffic ein
- Dokumentation: Führen Sie interne Dokumentation über Regeländerungen und die Begründung jeder Konfiguration
- Testprotokoll: Testen Sie neue Regeln im „Log"-Modus, bevor Sie sie in der Produktion einsetzen, um potenzielle Probleme zu identifizieren
Koordination mit Robots.txt
WAF-Regeln sollten Ihre robots.txt-Direktiven ergänzen, nicht ersetzen. Verfolgen Sie einen koordinierten Ansatz:
# Nützliche KI-Crawler zulassen User-agent: PerplexityBot Allow: / User-agent: GPTBot Allow: / User-agent: OAI-SearchBot Allow: / User-agent: Google-Extended Allow: / User-agent: Applebot Allow: / User-agent: anthropic-ai Allow: / # Aggressive Scraper blockieren User-agent: Bytespider Disallow: / User-agent: PetalBot Disallow: / User-agent: AhrefsBot Crawl-delay: 10 Disallow: /api/ User-agent: SemrushBot Crawl-delay: 10 Disallow: /api/
Überlegungen zur Performance-Auswirkung
WAF-Regeln werden bei jeder Anfrage ausgeführt, daher ist Optimierung für die Aufrechterhaltung der Website-Performance entscheidend:
- Regelreihenfolge: Platzieren Sie am häufigsten übereinstimmende Regeln (Zulassungsregeln für gängige Crawler) mit höherer Priorität, um die Verarbeitungszeit zu reduzieren
- Ausdruckseffizienz: Verwenden Sie einfachen String-Abgleich (contains) anstelle komplexer Regex, wenn möglich
- Regelkonsolidierung: Kombinieren Sie verwandte Bedingungen in einzelnen Regeln, anstatt mehrere überlappende Regeln zu erstellen
- Caching-Integration: Stellen Sie sicher, dass WAF-Regeln nicht mit Cloudflares Caching interferieren, indem Sie unnötige Herausforderungen bei cachebaren Ressourcen vermeiden
- Geografische Überlegungen: Fügen Sie für regionsspezifische Inhalte geografische Filter hinzu, um unnötige Regelauswertungen zu reduzieren
Häufig gestellte Fragen
Warum sollte ich Cloudflares Ein-Klick-Funktion „KI-Bots blockieren" nicht verwenden?
Cloudflares globale KI-Bot-Blockierung ist ein unterschiedsloses Werkzeug, das alle KI-Crawler blockiert, einschließlich nützlicher wie Perplexity, ChatGPT Search und Googles KI-Funktionen. Diese Plattformen generieren erheblichen organischen Traffic und repräsentieren die Zukunft der Suche. Ihre Blockierung macht Ihre Inhalte für Millionen von Nutzern unsichtbar, die auf KI-gestützte Suchwerkzeuge angewiesen sind. Benutzerdefinierte WAF-Regeln ermöglichen es Ihnen, selektiv legitime KI-Suchmaschinen zuzulassen und gleichzeitig aggressive Scraper zu blockieren, die keinen Mehrwert bieten.
Wie überprüfe ich, ob meine WAF-Regeln korrekt funktionieren?
Überwachen Sie Ihre Regeln über Cloudflares Sicherheitsereignis-Dashboard (Sicherheit → Ereignisse). Dies zeigt Echtzeitdaten darüber, welche Regeln ausgelöst werden und welchen Traffic sie betreffen. Starten Sie neue Regeln im „Log"-Modus statt im „Block"-Modus, um ihr Verhalten zu beobachten, ohne den Traffic zu beeinträchtigen. Überprüfen Sie das Aktivitätsprotokoll in der ersten Woche nach Implementierung neuer Regeln täglich auf Fehlalarme. Sie können auch curl-Befehle mit verschiedenen User-Agent-Strings verwenden, um Ihre Regeln manuell zu testen.
Was ist der Unterschied zwischen den Aktionen „Blockieren" und „Verwaltete Herausforderung"?
„Blockieren" verweigert sofort den Zugriff ohne Möglichkeit für den Besucher fortzufahren und gibt einen 403-Forbidden-Fehler zurück. Dies ist angemessen für bekannte bösartige Bots und aggressive Scraper. „Verwaltete Herausforderung" präsentiert eine intelligente Herausforderung, die legitime Browser automatisch bestehen können, während Bots blockiert werden. Cloudflares System bestimmt den geeigneten Herausforderungstyp (unsichtbar, JavaScript-Herausforderung oder CAPTCHA) basierend auf den Anfrage-Merkmalen. Verwenden Sie Verwaltete Herausforderung für verdächtigen Traffic, der legitime Nutzer enthalten könnte, und Blockieren für bestätigte bösartige Quellen.
Wie oft sollte ich meine KI-Crawler-Whitelist aktualisieren?
Überprüfen und aktualisieren Sie Ihre Whitelist mindestens vierteljährlich, da sich die KI-Suchlandschaft schnell entwickelt. Neue KI-Suchmaschinen starten regelmäßig, und bestehende können ihre Crawler-User-Agents oder IP-Bereiche ändern. Abonnieren Sie Ankündigungen großer KI-Unternehmen (OpenAI, Anthropic, Google, Perplexity), um über Crawler-Änderungen informiert zu bleiben. Überwachen Sie Ihr Sicherheitsereignisprotokoll auf blockierte User-Agents, die möglicherweise legitime neue Crawler sind. Wenn große KI-Suchprodukte starten (wie ChatGPT Search oder neue Google-KI-Funktionen), aktualisieren Sie Ihre Regeln sofort, um die Sichtbarkeit aufrechtzuerhalten.
Können legitime KI-Crawler ihre User-Agents fälschen, um meine Regeln zu umgehen?
Während User-Agents gefälscht werden können, beteiligen sich legitime KI-Unternehmen nicht an dieser Praxis, da dies ihrem Ruf schaden und Webmaster-Richtlinien verletzen würde. Bösartige Akteure können jedoch legitime Crawler-User-Agents fälschen. Deshalb ist die IP-Bereichsverifizierung entscheidend. Verwenden Sie Cloudflares cf.bot_management.verified_bot-Feld, das validiert, dass Anfragen, die behaupten, von bekannten Bots zu stammen, tatsächlich aus verifizierten IP-Bereichen stammen. Implementieren Sie für hochwertige Inhalte Regeln, die sowohl korrekten User-Agent ALS AUCH verifizierten IP-Bereich erfordern. Dies verhindert Spoofing und erlaubt gleichzeitig legitime Crawler.
Welche Rate Limits sind für KI-Crawler angemessen?
Legitime KI-Crawler respektieren typischerweise angemessene Rate Limits und Crawl-Delay-Direktiven. Für nützliche Crawler wie PerplexityBot und GPTBot befreien Sie sie vollständig vom Rate Limiting oder setzen Sie sehr großzügige Limits (1000+ Anfragen pro 5 Minuten). Diese Crawler sind bereits darauf ausgelegt, respektvoll zu sein und werden Ihren Server nicht überlasten. Für aggressive SEO-Crawler wie AhrefsBot oder SemrushBot implementieren Sie strikte Limits (10-20 Anfragen pro Minute), um Ressourcenerschöpfung zu verhindern. Überwachen Sie Ihre Serverlast und passen Sie Limits basierend auf Ihrer Infrastrukturkapazität an. API-Endpunkte sollten strengere Limits haben als Content-Seiten.
Sollte ich alle Python- und curl-User-Agents blockieren?
Das Blockieren generischer User-Agents wie „python-requests" oder „curl" kann gegen unsophistizierte Scraper effektiv sein, kann aber auch legitime automatisierte Tools, Überwachungsdienste und interne Skripte blockieren. Anstelle pauschaler Blockierung verwenden Sie einen mehrschichtigen Ansatz: Blockieren Sie diese User-Agents nur auf sensiblen Endpunkten (APIs, Admin-Panels), während Sie sie auf öffentlichen Inhalten zulassen. Alternativ verwenden Sie Rate Limiting statt vollständiger Blockierung – legitime Tools werden Rate Limits respektieren, während aggressive Scraper Blockierungen auslösen. Erwägen Sie die Implementierung von API-Key-Authentifizierung für programmatischen Zugriff, anstatt sich ausschließlich auf User-Agent-Blockierung zu verlassen.
Wie gehe ich mit Fehlalarmen um, bei denen legitime Nutzer blockiert werden?
Fehlalarme sind bei aggressivem Bot-Management unvermeidlich. Implementieren Sie einen klaren Entsperrungsprozess: Erstellen Sie eine dedizierte Seite, die erklärt, warum die Blockierung erfolgte, und Kontaktinformationen für legitime Nutzer zur Anforderung der Entsperrung bereitstellt. Verwenden Sie „Verwaltete Herausforderung" statt „Blockieren" für Grenzfälle, da dies legitimen Nutzern ermöglicht zu beweisen, dass sie Menschen sind. Überwachen Sie Ihr Sicherheitsereignis-Dashboard täglich auf Muster, die auf Fehlalarme hinweisen (z.B. Blockierungen von Unternehmens-IP-Bereichen, bestimmten geografischen Regionen oder während der Geschäftszeiten). Führen Sie eine Whitelist bekannter guter IP-Bereiche (Ihr Büro, große Unternehmensnetzwerke, Cloud-Provider, die von legitimen Diensten verwendet werden).
Welche Auswirkungen haben diese WAF-Regeln auf meine Cloudflare-Rechnung?
Benutzerdefinierte WAF-Regeln sind in Cloudflare Pro-Plänen und höher enthalten, mit Limits für die Anzahl der Regeln, die Sie erstellen können (typischerweise 10-100 je nach Plan). Die Regeln selbst verursachen keine Gebühren pro Anfrage – sie werden als Teil der Standard-Anfrageverarbeitung von Cloudflare ausgewertet. Rate-Limiting-Regeln können bei einigen Plänen separate Preise haben. Bot-Management-Funktionen (cf.bot_management.score) erfordern einen Business- oder Enterprise-Plan. Die Performance-Auswirkung ist minimal, da Cloudflares Edge-Netzwerk diese Regeln effizient verarbeitet. Die Kosteneinsparungen durch Blockierung bösartigen Traffics (reduzierte Bandbreite, Serverlast und Scraping-bezogene Kosten) übersteigen typischerweise bei weitem zusätzliche Cloudflare-Gebühren.
Wie balanciere ich SEO-Crawler-Zugriff mit Scraper-Schutz?
Unterscheiden Sie zwischen legitimen SEO-Crawlern (Googlebot, Bingbot) und aggressiven SEO-Tools (AhrefsBot, SemrushBot). Erlauben Sie immer verifizierte Suchmaschinen-Crawler – verwenden Sie cf.bot_management.verified_bot, um sicherzustellen, dass sie legitim sind. Für SEO-Tool-Crawler implementieren Sie Rate Limiting statt Blockierung, wenn Sie deren Daten für Wettbewerbsanalysen nützlich finden. Verwenden Sie robots.txt-Crawl-Delay-Direktiven, um aggressive Crawler zu verlangsamen, ohne sie vollständig zu blockieren. Für Premium- oder geschützte Inhalte blockieren Sie alle Crawler außer verifizierten Suchmaschinen. Denken Sie daran, dass legitime Suchmaschinen-Crawler (Google, Bing) für traditionelles SEO unerlässlich sind, während KI-Such-Crawler (Perplexity, ChatGPT) für KI-Suchsichtbarkeit unerlässlich sind – Sie brauchen beide.
Kann ich diese Regeln verwenden, um ein kostenpflichtiges API-Zugangsmodell zu erstellen?
Ja, WAF-Regeln können ein gestaffeltes Zugangsmodell durchsetzen. Erstellen Sie Regeln, die allen automatisierten Zugriff auf bestimmte Endpunkte blockieren, geben Sie dann API-Keys an zahlende Kunden aus und setzen Sie deren IP-Bereiche auf die Whitelist oder verlangen Sie Authentifizierungs-Header. Verwenden Sie Cloudflare Workers in Kombination mit WAF-Regeln für anspruchsvollere Authentifizierung. Implementieren Sie Rate-Limiting-Stufen basierend auf Abonnementstufe – kostenlose Stufe erhält 100 Anfragen/Stunde, bezahlte Stufe erhält 10.000 Anfragen/Stunde. Für KI-Unternehmen, die auf Ihren Inhalten trainieren möchten, können Sie selektiv deren Crawler für bestimmte Bereiche zulassen, während Sie kommerzielle Vereinbarungen für Premium-Inhalte verlangen. Dieser Ansatz wird zunehmend üblich, da Publisher versuchen, den Zugang zu KI-Trainingsdaten zu monetarisieren.
Was sollte ich tun, wenn eine neue KI-Suchmaschine startet?
Wenn eine neue KI-Suchmaschine startet, recherchieren Sie deren Crawler-Dokumentation, um deren User-Agent-String und IP-Bereiche zu identifizieren. Die meisten legitimen KI-Unternehmen veröffentlichen diese Informationen in ihrer robots.txt-Dokumentation oder auf Entwicklerseiten. Fügen Sie deren User-Agent innerhalb von 24-48 Stunden nach Start zu Ihrer Whitelist hinzu, um sicherzustellen, dass Ihre Inhalte früh indexiert werden. Überwachen Sie Sicherheitsereignisse, um zu sehen, ob deren Crawler von bestehenden Regeln blockiert wird. Berücksichtigen Sie den Ruf des Unternehmens und den potenziellen Traffic-Wert, bevor Sie deren Crawler zulassen – nicht alle KI-Suchmaschinen werden bedeutenden Traffic generieren. Treten Sie Webmaster-Communities und Foren bei, wo neue Crawler-Starts diskutiert werden, um über aufkommende Plattformen informiert zu bleiben.