Methodology v1.0
July 18, 2026 • By AICompatible Team • 8 min read

So konfigurieren Sie Cloudflare WAF-Regeln, um Perplexity und ChatGPT zuzulassen und gleichzeitig aggressive Crawler zu blockieren

Cloudflares KI-Bot-Verwaltung verstehen: Warum die globale Blockier-Schaltfläche gefährlich ist

Cloudflares Ein-Klick-Funktion „KI-Bots blockieren" blockiert unterschiedslos alle KI-Crawler, einschließlich nützlicher Suchmaschinen wie Perplexity und ChatGPT, die erheblichen organischen Traffic auf Ihre Website bringen. Diese Radikallösung verhindert, dass Ihre Inhalte von KI-Suchplattformen der nächsten Generation indexiert werden, wodurch Ihre Website für Millionen von Nutzern unsichtbar wird, die auf KI-gestützte Suchwerkzeuge zur Informationsbeschaffung angewiesen sind.

Die strategische Bedeutung selektiver KI-Bot-Verwaltung

Moderner Web-Traffic stammt zunehmend von KI-gestützten Suchmaschinen und Assistenten. Perplexity, ChatGPT Search, Googles KI-Übersichten und ähnliche Plattformen repräsentieren die Zukunft der Informationsbeschaffung. Das Blockieren dieser legitimen Crawler bei gleichzeitiger Verwendung von Cloudflares pauschaler KI-Bot-Blockierung schafft eine kritische Sichtbarkeitslücke, die die Auffindbarkeit und organische Reichweite Ihrer Website erheblich beeinträchtigen kann.

Die Lösung liegt in der Implementierung granularer Web Application Firewall (WAF)-Regeln, die zwischen nützlichen KI-Crawlern und aggressiven Scrapern unterscheiden, die Bandbreite verbrauchen, ohne Mehrwert zu bieten. Dieser Leitfaden bietet umfassende Anweisungen zur Konfiguration von Cloudflare WAF-Regeln, die Ihre Infrastruktur schützen und gleichzeitig die Sichtbarkeit in KI-Such-Ökosystemen aufrechterhalten.

Wichtige KI-Crawler User-Agents und IP-Bereiche

Bevor Sie WAF-Regeln konfigurieren, müssen Sie die Identifikationsmethoden verstehen, die von legitimen KI-Crawlern verwendet werden. Die folgende Tabelle bietet umfassende Informationen über wichtige KI-Bot User-Agents und ihre zugehörigen IP-Bereiche:

Anbieter User-Agent-Token Vollständiges User-Agent-Beispiel IP-Bereichsverifizierung Robots.txt-Token
Perplexity AI PerplexityBot Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; PerplexityBot/1.0; +https://perplexity.ai/bot) Verifizierung über Reverse-DNS-Lookup PerplexityBot
OpenAI (ChatGPT) GPTBot Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; GPTBot/1.0; +https://openai.com/gptbot) Veröffentlichtes JSON unter openai.com/gptbot.json GPTBot
OpenAI (SearchGPT) OAI-SearchBot Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; OAI-SearchBot/1.0; +https://openai.com/searchbot) Veröffentlichtes JSON unter openai.com/searchbot.json OAI-SearchBot
Google (Gemini) Google-Extended Mozilla/5.0 (compatible; Google-Extended/1.0; +http://www.google.com/bot.html) Verifizierung über Google-IP-Bereiche Google-Extended
Anthropic (Claude) anthropic-ai anthropic-ai (compatible; Claude-Web/1.0; +https://anthropic.com/bot) Verifizierung über Reverse-DNS anthropic-ai
Apple (Applebot) Applebot Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/605.1.15 (KHTML, like Gecko) Version/17.4 Safari/605.1.15 (Applebot/0.1; +http://www.apple.com/go/applebot) 17.0.0.0/8 (primärer Bereich) Applebot
Cohere cohere-ai cohere-ai (compatible; CohereBot/1.0; +https://cohere.com/bot) Verifizierung über Reverse-DNS cohere-ai
Meta AI FacebookBot facebookexternalhit/1.1 (+http://www.facebook.com/externalhit_uatext.php) Veröffentlichtes ASN: AS32934, AS63293 FacebookBot

Konfiguration benutzerdefinierter WAF-Regeln zur Zulassung nützlicher KI-Crawler

Cloudflares benutzerdefinierte WAF-Regeln bieten die Flexibilität, ausgefeilte Bot-Verwaltungsrichtlinien zu erstellen. Die folgende Konfiguration erlaubt legitime KI-Such-Crawler und blockiert gleichzeitig aggressive Scraper und nicht autorisierte Bots.

Schritt 1: Zugriff auf benutzerdefinierte Cloudflare WAF-Regeln

  1. Melden Sie sich in Ihrem Cloudflare-Dashboard an
  2. Wählen Sie die Domain aus, die Sie konfigurieren möchten
  3. Navigieren Sie zu SicherheitWAFBenutzerdefinierte Regeln
  4. Klicken Sie auf Regel erstellen, um mit der Konfiguration Ihres benutzerdefinierten Regelwerks zu beginnen

Schritt 2: Erstellen Sie eine Zulassungsregel für legitime KI-Crawler

Erstellen Sie eine Regel mit der folgenden Konfiguration:

Regelname: Legitime KI-Such-Crawler zulassen

Ausdruck:

(http.user_agent contains "PerplexityBot") or
(http.user_agent contains "GPTBot") or
(http.user_agent contains "OAI-SearchBot") or
(http.user_agent contains "Google-Extended") or
(http.user_agent contains "anthropic-ai") or
(http.user_agent contains "Applebot") or
(http.user_agent contains "cohere-ai") or
(http.user_agent contains "FacebookBot" and not http.user_agent contains "facebookexternalhit")

Aktion: Zulassen

Priorität: Auf 1 setzen (höchste Priorität, um sicherzustellen, dass diese Regel zuerst ausgeführt wird)

Schritt 3: Erstellen Sie eine Blockierregel für aggressive generische Scraper

Erstellen Sie nach der Zulassung legitimer Crawler eine sekundäre Regel, um bekannte aggressive Scraper zu blockieren:

Regelname: Aggressive Scraper und nicht autorisierte Bots blockieren

Ausdruck:

(http.user_agent contains "scrapy") or
(http.user_agent contains "python-requests") or
(http.user_agent contains "curl") or
(http.user_agent contains "wget") or
(http.user_agent contains "go-http-client") or
(http.user_agent contains "axios") or
(http.user_agent contains "node-fetch") or
(http.user_agent eq "") or
(http.user_agent contains "Bytespider") or
(http.user_agent contains "PetalBot") or
(http.user_agent contains "AhrefsBot" and not cf.bot_management.verified_bot) or
(http.user_agent contains "SemrushBot" and not cf.bot_management.verified_bot) or
(http.user_agent contains "DotBot") or
(http.user_agent contains "MJ12bot") or
(http.user_agent contains "BLEXBot")

Aktion: Blockieren

Priorität: Auf 2 setzen

Schritt 4: Implementieren Sie Challenge-Regeln für verdächtige Traffic-Muster

Für Traffic, der weder den Zulassungs- noch den Blockierkriterien entspricht, aber verdächtige Muster aufweist, implementieren Sie eine Challenge-Regel:

Regelname: Verdächtiges Bot-ähnliches Verhalten herausfordern

Ausdruck:

(cf.bot_management.score lt 30) and
not (cf.bot_management.verified_bot) and
not (http.user_agent contains "PerplexityBot") and
not (http.user_agent contains "GPTBot") and
not (http.user_agent contains "OAI-SearchBot") and
not (http.user_agent contains "Google-Extended") and
not (http.user_agent contains "Applebot")

Aktion: Verwaltete Herausforderung

Priorität: Auf 3 setzen

Implementierung benutzerdefinierter Rate-Limiting-Regeln zum Schutz von API-Endpunkten

Rate Limiting bietet eine zusätzliche Schutzebene gegen Scraping-Missbrauch, insbesondere für API-Endpunkte und ressourcenintensive Seiten. Befolgen Sie diese Schritte, um intelligentes Rate Limiting zu konfigurieren, das legitime KI-Crawler nicht beeinträchtigt:

Schritt 1: Navigieren Sie zu Rate-Limiting-Regeln

  1. Gehen Sie in Ihrem Cloudflare-Dashboard zu SicherheitWAFRate-Limiting-Regeln
  2. Klicken Sie auf Regel erstellen

Schritt 2: Konfigurieren Sie API-Endpunkt Rate Limiting

Regelname: API-Endpunkt Rate Limiting mit KI-Crawler-Ausnahme

Ausdruck:

(http.request.uri.path contains "/api/") and
not (http.user_agent contains "PerplexityBot") and
not (http.user_agent contains "GPTBot") and
not (http.user_agent contains "OAI-SearchBot") and
not (http.user_agent contains "Applebot") and
not (cf.bot_management.verified_bot)

Merkmale:

  • Anfragen: 100 Anfragen
  • Zeitraum: 60 Sekunden
  • Zählmethode: Nach IP-Adresse zählen

Aktion: Für 1 Stunde blockieren

Schritt 3: Konfigurieren Sie Content-Seiten Rate Limiting

Implementieren Sie für Content-Seiten großzügigere Rate Limits, die legitime Lesemuster berücksichtigen:

Regelname: Content-Seiten Rate Limiting

Ausdruck:

(http.request.uri.path contains "/blog/" or http.request.uri.path contains "/articles/") and
not (http.user_agent contains "PerplexityBot") and
not (http.user_agent contains "GPTBot") and
not (http.user_agent contains "OAI-SearchBot") and
not (http.user_agent contains "Google-Extended") and
not (http.user_agent contains "Applebot") and
not (cf.bot_management.verified_bot)

Merkmale:

  • Anfragen: 300 Anfragen
  • Zeitraum: 300 Sekunden (5 Minuten)
  • Zählmethode: Nach IP-Adresse zählen

Aktion: Verwaltete Herausforderung

Schritt 4: Implementieren Sie aggressives Crawler Rate Limiting

Erstellen Sie ein striktes Rate Limit speziell für bekannte aggressive Crawler, die nicht vollständig blockiert wurden:

Regelname: Aggressive Crawler drosseln

Ausdruck:

(http.user_agent contains "AhrefsBot") or
(http.user_agent contains "SemrushBot") or
(http.user_agent contains "MJ12bot") or
(cf.bot_management.score lt 20 and not cf.bot_management.verified_bot)

Merkmale:

  • Anfragen: 10 Anfragen
  • Zeitraum: 60 Sekunden
  • Zählmethode: Nach IP-Adresse zählen

Aktion: Für 24 Stunden blockieren

Schritt 5: Überwachen und Anpassen von Rate Limits

  1. Navigieren Sie zu SicherheitEreignisse, um ausgelöste Regeln zu überwachen
  2. Überprüfen Sie das Aktivitätsprotokoll auf Fehlalarme, die legitimen Traffic betreffen
  3. Passen Sie Rate-Limit-Schwellenwerte basierend auf den typischen Traffic-Mustern Ihrer Website an
  4. Verwenden Sie AnalyticsSicherheit, um aufkommende Scraper-Muster zu identifizieren
  5. Aktualisieren Sie Ihre Whitelist vierteljährlich, wenn neue KI-Suchmaschinen entstehen

Erweiterte Konfiguration: IP-Bereichsverifizierung

User-Agent-Strings können gefälscht werden, weshalb die IP-Bereichsverifizierung eine wesentliche sekundäre Validierungsmethode darstellt. Implementieren Sie diese erweiterten Regeln für erhöhte Sicherheit:

Validierung verifizierter Bot-IP-Bereiche

Erstellen Sie eine Regel, die sowohl korrekten User-Agent ALS AUCH IP-Bereichsverifizierung für hochwertige Inhalte erfordert:

(http.request.uri.path contains "/premium/") and
(
  (http.user_agent contains "GPTBot" and not cf.bot_management.verified_bot) or
  (http.user_agent contains "PerplexityBot" and not cf.bot_management.verified_bot)
)

Aktion: Verwaltete Herausforderung

Diese Regel fordert Crawler heraus, die behaupten, legitime KI-Bots zu sein, aber nicht aus verifizierten IP-Bereichen stammen, und schützt Premium-Inhalte vor Spoofing-Versuchen.

Best Practices für Überwachung und Wartung

Effektives WAF-Regelmanagement erfordert kontinuierliche Überwachung und Anpassung. Implementieren Sie diese Best Practices:

  • Wöchentliche Überprüfung: Prüfen Sie Sicherheitsereignisse auf blockierten legitimen Traffic und passen Sie Regeln entsprechend an
  • Monatliche Analyse: Überprüfen Sie Analytics-Daten, um neue Crawler-User-Agents und aufkommende Scraping-Muster zu identifizieren
  • Vierteljährliche Updates: Aktualisieren Sie Ihre Whitelist, wenn neue KI-Suchmaschinen starten und bestehende ihre Crawler modifizieren
  • Alarm-Konfiguration: Richten Sie Cloudflare-Benachrichtigungen für ungewöhnliche Spitzen bei blockiertem Traffic ein
  • Dokumentation: Führen Sie interne Dokumentation über Regeländerungen und die Begründung jeder Konfiguration
  • Testprotokoll: Testen Sie neue Regeln im „Log"-Modus, bevor Sie sie in der Produktion einsetzen, um potenzielle Probleme zu identifizieren

Koordination mit Robots.txt

WAF-Regeln sollten Ihre robots.txt-Direktiven ergänzen, nicht ersetzen. Verfolgen Sie einen koordinierten Ansatz:

# Nützliche KI-Crawler zulassen
User-agent: PerplexityBot
Allow: /

User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: Google-Extended
Allow: /

User-agent: Applebot
Allow: /

User-agent: anthropic-ai
Allow: /

# Aggressive Scraper blockieren
User-agent: Bytespider
Disallow: /

User-agent: PetalBot
Disallow: /

User-agent: AhrefsBot
Crawl-delay: 10
Disallow: /api/

User-agent: SemrushBot
Crawl-delay: 10
Disallow: /api/

Überlegungen zur Performance-Auswirkung

WAF-Regeln werden bei jeder Anfrage ausgeführt, daher ist Optimierung für die Aufrechterhaltung der Website-Performance entscheidend:

  • Regelreihenfolge: Platzieren Sie am häufigsten übereinstimmende Regeln (Zulassungsregeln für gängige Crawler) mit höherer Priorität, um die Verarbeitungszeit zu reduzieren
  • Ausdruckseffizienz: Verwenden Sie einfachen String-Abgleich (contains) anstelle komplexer Regex, wenn möglich
  • Regelkonsolidierung: Kombinieren Sie verwandte Bedingungen in einzelnen Regeln, anstatt mehrere überlappende Regeln zu erstellen
  • Caching-Integration: Stellen Sie sicher, dass WAF-Regeln nicht mit Cloudflares Caching interferieren, indem Sie unnötige Herausforderungen bei cachebaren Ressourcen vermeiden
  • Geografische Überlegungen: Fügen Sie für regionsspezifische Inhalte geografische Filter hinzu, um unnötige Regelauswertungen zu reduzieren

Häufig gestellte Fragen

Warum sollte ich Cloudflares Ein-Klick-Funktion „KI-Bots blockieren" nicht verwenden?

Cloudflares globale KI-Bot-Blockierung ist ein unterschiedsloses Werkzeug, das alle KI-Crawler blockiert, einschließlich nützlicher wie Perplexity, ChatGPT Search und Googles KI-Funktionen. Diese Plattformen generieren erheblichen organischen Traffic und repräsentieren die Zukunft der Suche. Ihre Blockierung macht Ihre Inhalte für Millionen von Nutzern unsichtbar, die auf KI-gestützte Suchwerkzeuge angewiesen sind. Benutzerdefinierte WAF-Regeln ermöglichen es Ihnen, selektiv legitime KI-Suchmaschinen zuzulassen und gleichzeitig aggressive Scraper zu blockieren, die keinen Mehrwert bieten.

Wie überprüfe ich, ob meine WAF-Regeln korrekt funktionieren?

Überwachen Sie Ihre Regeln über Cloudflares Sicherheitsereignis-Dashboard (Sicherheit → Ereignisse). Dies zeigt Echtzeitdaten darüber, welche Regeln ausgelöst werden und welchen Traffic sie betreffen. Starten Sie neue Regeln im „Log"-Modus statt im „Block"-Modus, um ihr Verhalten zu beobachten, ohne den Traffic zu beeinträchtigen. Überprüfen Sie das Aktivitätsprotokoll in der ersten Woche nach Implementierung neuer Regeln täglich auf Fehlalarme. Sie können auch curl-Befehle mit verschiedenen User-Agent-Strings verwenden, um Ihre Regeln manuell zu testen.

Was ist der Unterschied zwischen den Aktionen „Blockieren" und „Verwaltete Herausforderung"?

„Blockieren" verweigert sofort den Zugriff ohne Möglichkeit für den Besucher fortzufahren und gibt einen 403-Forbidden-Fehler zurück. Dies ist angemessen für bekannte bösartige Bots und aggressive Scraper. „Verwaltete Herausforderung" präsentiert eine intelligente Herausforderung, die legitime Browser automatisch bestehen können, während Bots blockiert werden. Cloudflares System bestimmt den geeigneten Herausforderungstyp (unsichtbar, JavaScript-Herausforderung oder CAPTCHA) basierend auf den Anfrage-Merkmalen. Verwenden Sie Verwaltete Herausforderung für verdächtigen Traffic, der legitime Nutzer enthalten könnte, und Blockieren für bestätigte bösartige Quellen.

Wie oft sollte ich meine KI-Crawler-Whitelist aktualisieren?

Überprüfen und aktualisieren Sie Ihre Whitelist mindestens vierteljährlich, da sich die KI-Suchlandschaft schnell entwickelt. Neue KI-Suchmaschinen starten regelmäßig, und bestehende können ihre Crawler-User-Agents oder IP-Bereiche ändern. Abonnieren Sie Ankündigungen großer KI-Unternehmen (OpenAI, Anthropic, Google, Perplexity), um über Crawler-Änderungen informiert zu bleiben. Überwachen Sie Ihr Sicherheitsereignisprotokoll auf blockierte User-Agents, die möglicherweise legitime neue Crawler sind. Wenn große KI-Suchprodukte starten (wie ChatGPT Search oder neue Google-KI-Funktionen), aktualisieren Sie Ihre Regeln sofort, um die Sichtbarkeit aufrechtzuerhalten.

Können legitime KI-Crawler ihre User-Agents fälschen, um meine Regeln zu umgehen?

Während User-Agents gefälscht werden können, beteiligen sich legitime KI-Unternehmen nicht an dieser Praxis, da dies ihrem Ruf schaden und Webmaster-Richtlinien verletzen würde. Bösartige Akteure können jedoch legitime Crawler-User-Agents fälschen. Deshalb ist die IP-Bereichsverifizierung entscheidend. Verwenden Sie Cloudflares cf.bot_management.verified_bot-Feld, das validiert, dass Anfragen, die behaupten, von bekannten Bots zu stammen, tatsächlich aus verifizierten IP-Bereichen stammen. Implementieren Sie für hochwertige Inhalte Regeln, die sowohl korrekten User-Agent ALS AUCH verifizierten IP-Bereich erfordern. Dies verhindert Spoofing und erlaubt gleichzeitig legitime Crawler.

Welche Rate Limits sind für KI-Crawler angemessen?

Legitime KI-Crawler respektieren typischerweise angemessene Rate Limits und Crawl-Delay-Direktiven. Für nützliche Crawler wie PerplexityBot und GPTBot befreien Sie sie vollständig vom Rate Limiting oder setzen Sie sehr großzügige Limits (1000+ Anfragen pro 5 Minuten). Diese Crawler sind bereits darauf ausgelegt, respektvoll zu sein und werden Ihren Server nicht überlasten. Für aggressive SEO-Crawler wie AhrefsBot oder SemrushBot implementieren Sie strikte Limits (10-20 Anfragen pro Minute), um Ressourcenerschöpfung zu verhindern. Überwachen Sie Ihre Serverlast und passen Sie Limits basierend auf Ihrer Infrastrukturkapazität an. API-Endpunkte sollten strengere Limits haben als Content-Seiten.

Sollte ich alle Python- und curl-User-Agents blockieren?

Das Blockieren generischer User-Agents wie „python-requests" oder „curl" kann gegen unsophistizierte Scraper effektiv sein, kann aber auch legitime automatisierte Tools, Überwachungsdienste und interne Skripte blockieren. Anstelle pauschaler Blockierung verwenden Sie einen mehrschichtigen Ansatz: Blockieren Sie diese User-Agents nur auf sensiblen Endpunkten (APIs, Admin-Panels), während Sie sie auf öffentlichen Inhalten zulassen. Alternativ verwenden Sie Rate Limiting statt vollständiger Blockierung – legitime Tools werden Rate Limits respektieren, während aggressive Scraper Blockierungen auslösen. Erwägen Sie die Implementierung von API-Key-Authentifizierung für programmatischen Zugriff, anstatt sich ausschließlich auf User-Agent-Blockierung zu verlassen.

Wie gehe ich mit Fehlalarmen um, bei denen legitime Nutzer blockiert werden?

Fehlalarme sind bei aggressivem Bot-Management unvermeidlich. Implementieren Sie einen klaren Entsperrungsprozess: Erstellen Sie eine dedizierte Seite, die erklärt, warum die Blockierung erfolgte, und Kontaktinformationen für legitime Nutzer zur Anforderung der Entsperrung bereitstellt. Verwenden Sie „Verwaltete Herausforderung" statt „Blockieren" für Grenzfälle, da dies legitimen Nutzern ermöglicht zu beweisen, dass sie Menschen sind. Überwachen Sie Ihr Sicherheitsereignis-Dashboard täglich auf Muster, die auf Fehlalarme hinweisen (z.B. Blockierungen von Unternehmens-IP-Bereichen, bestimmten geografischen Regionen oder während der Geschäftszeiten). Führen Sie eine Whitelist bekannter guter IP-Bereiche (Ihr Büro, große Unternehmensnetzwerke, Cloud-Provider, die von legitimen Diensten verwendet werden).

Welche Auswirkungen haben diese WAF-Regeln auf meine Cloudflare-Rechnung?

Benutzerdefinierte WAF-Regeln sind in Cloudflare Pro-Plänen und höher enthalten, mit Limits für die Anzahl der Regeln, die Sie erstellen können (typischerweise 10-100 je nach Plan). Die Regeln selbst verursachen keine Gebühren pro Anfrage – sie werden als Teil der Standard-Anfrageverarbeitung von Cloudflare ausgewertet. Rate-Limiting-Regeln können bei einigen Plänen separate Preise haben. Bot-Management-Funktionen (cf.bot_management.score) erfordern einen Business- oder Enterprise-Plan. Die Performance-Auswirkung ist minimal, da Cloudflares Edge-Netzwerk diese Regeln effizient verarbeitet. Die Kosteneinsparungen durch Blockierung bösartigen Traffics (reduzierte Bandbreite, Serverlast und Scraping-bezogene Kosten) übersteigen typischerweise bei weitem zusätzliche Cloudflare-Gebühren.

Wie balanciere ich SEO-Crawler-Zugriff mit Scraper-Schutz?

Unterscheiden Sie zwischen legitimen SEO-Crawlern (Googlebot, Bingbot) und aggressiven SEO-Tools (AhrefsBot, SemrushBot). Erlauben Sie immer verifizierte Suchmaschinen-Crawler – verwenden Sie cf.bot_management.verified_bot, um sicherzustellen, dass sie legitim sind. Für SEO-Tool-Crawler implementieren Sie Rate Limiting statt Blockierung, wenn Sie deren Daten für Wettbewerbsanalysen nützlich finden. Verwenden Sie robots.txt-Crawl-Delay-Direktiven, um aggressive Crawler zu verlangsamen, ohne sie vollständig zu blockieren. Für Premium- oder geschützte Inhalte blockieren Sie alle Crawler außer verifizierten Suchmaschinen. Denken Sie daran, dass legitime Suchmaschinen-Crawler (Google, Bing) für traditionelles SEO unerlässlich sind, während KI-Such-Crawler (Perplexity, ChatGPT) für KI-Suchsichtbarkeit unerlässlich sind – Sie brauchen beide.

Kann ich diese Regeln verwenden, um ein kostenpflichtiges API-Zugangsmodell zu erstellen?

Ja, WAF-Regeln können ein gestaffeltes Zugangsmodell durchsetzen. Erstellen Sie Regeln, die allen automatisierten Zugriff auf bestimmte Endpunkte blockieren, geben Sie dann API-Keys an zahlende Kunden aus und setzen Sie deren IP-Bereiche auf die Whitelist oder verlangen Sie Authentifizierungs-Header. Verwenden Sie Cloudflare Workers in Kombination mit WAF-Regeln für anspruchsvollere Authentifizierung. Implementieren Sie Rate-Limiting-Stufen basierend auf Abonnementstufe – kostenlose Stufe erhält 100 Anfragen/Stunde, bezahlte Stufe erhält 10.000 Anfragen/Stunde. Für KI-Unternehmen, die auf Ihren Inhalten trainieren möchten, können Sie selektiv deren Crawler für bestimmte Bereiche zulassen, während Sie kommerzielle Vereinbarungen für Premium-Inhalte verlangen. Dieser Ansatz wird zunehmend üblich, da Publisher versuchen, den Zugang zu KI-Trainingsdaten zu monetarisieren.

Was sollte ich tun, wenn eine neue KI-Suchmaschine startet?

Wenn eine neue KI-Suchmaschine startet, recherchieren Sie deren Crawler-Dokumentation, um deren User-Agent-String und IP-Bereiche zu identifizieren. Die meisten legitimen KI-Unternehmen veröffentlichen diese Informationen in ihrer robots.txt-Dokumentation oder auf Entwicklerseiten. Fügen Sie deren User-Agent innerhalb von 24-48 Stunden nach Start zu Ihrer Whitelist hinzu, um sicherzustellen, dass Ihre Inhalte früh indexiert werden. Überwachen Sie Sicherheitsereignisse, um zu sehen, ob deren Crawler von bestehenden Regeln blockiert wird. Berücksichtigen Sie den Ruf des Unternehmens und den potenziellen Traffic-Wert, bevor Sie deren Crawler zulassen – nicht alle KI-Suchmaschinen werden bedeutenden Traffic generieren. Treten Sie Webmaster-Communities und Foren bei, wo neue Crawler-Starts diskutiert werden, um über aufkommende Plattformen informiert zu bleiben.