AI Crawler steuern: LLM-Bots blocken oder zulassen?
Sollst du AI Crawler blocken oder zulassen? Diese Frage stellt sich fast jedes Unternehmen, seit LLM-Bots von OpenAI, Anthropic, Perplexity und Google in großem Umfang durchs Web ziehen. Die kurze Antwort: Es ist keine Schwarz-Weiß-Entscheidung. Im eingebetteten Video erklärt SEOSOON-Geschäftsführerin Juliane Bettinga im SEOPRESSO Podcast mit Björn, wie du AI Crawler differenziert nach Bot-Typ steuerst, welche Rolle robots.txt und serverseitige Maßnahmen spielen und warum Server-Logs zur wichtigsten Datenquelle für AI Search werden. Darunter findest du das bereinigte Transkript, eine Zusammenfassung und einen ausführlichen Praxisteil mit robots.txt-Beispiel, User-Agent-Tabelle und FAQ.
AI Crawler blocken oder zulassen: eine Entscheidung nach Bot-Typ
Ergänzend zum Video haben wir die Entscheidungslogik als praktische Anleitung aufbereitet. Trenne zuerst die drei Ziele, um die es beim AI Crawling geht, sie lassen sich getrennt steuern:
Deine Inhalte fließen in Modelle ein: oft der Bereich, den man am ehesten einschränkt, vor allem bei exklusiven Inhalten.
Deine Inhalte werden für konkrete Nutzerfragen herangezogen: hier bringt Zulassen Sichtbarkeit in KI-Antworten.
Agenten führen im Auftrag von Nutzern Aktionen aus: am schwersten zu erkennen, weil über Headless Browser getarnt.
Als Faustregel: Grounding-/Such-Bots eher zulassen, Trainings-Zugriff und schützenswerte Verzeichnisse bewusst steuern, Agenten und Missbrauch serverseitig im Blick behalten.
Die wichtigsten AI-Crawler und ihre User-Agents
Ergänzend zum Video: Diese Übersicht der gängigen AI-Crawler hilft beim Erkennen in den Server-Logs und beim Formulieren der robots.txt. Die Namen sind die offiziellen User-Agent-Tokens der Anbieter (Stand der Recherche: August 2026, Angaben der Anbieter können sich ändern).
| Anbieter | User-Agent-Token | Zweck |
|---|---|---|
| OpenAI | GPTBot | Training der Modelle |
| OpenAI | OAI-SearchBot | Indexierung für die ChatGPT-Suche |
| OpenAI | ChatGPT-User | User-getriggerte Aufrufe (Grounding) |
| Anthropic | ClaudeBot | Training der Modelle |
| Anthropic | Claude-User | User-getriggerte Aufrufe |
| Anthropic | Claude-SearchBot | Indexierung für die Suche |
Google-Extended | Gemini/Vertex-Training und Grounding, ohne Einfluss auf das Such-Ranking | |
| Perplexity | PerplexityBot | Aufbau des Suchindex |
| Perplexity | Perplexity-User | User-getriggert; hält sich laut Berichten nicht zuverlässig an die robots.txt |
| Microsoft | Bingbot | Suche und Copilot (über NoArchive steuerbar) |
| Common Crawl | CCBot | öffentlicher Datensatz, den viele KI-Modelle nutzen |
| ByteDance | Bytespider | Training; oft hohes Crawl-Volumen |
| Meta | Meta-ExternalAgent | Training und KI-Produkte von Meta |
| Amazon | Amazonbot | Alexa/KI-Dienste (reagiert auf NoArchive) |
AI Crawler per robots.txt steuern: Beispiel
Ergänzend zum Video zeigen wir, wie eine robots.txt aussieht, die Training einschränkt, aber die
KI-Suche zulässt. Die robots.txt gehört ins Root-Verzeichnis
(https://deine-domain.de/robots.txt). Passe die Auswahl an deine Strategie an.
# Training einschraenken
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Bytespider
Disallow: /
# KI-Suche und user-getriggerte Aufrufe zulassen
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-SearchBot
Allow: /
Wichtig: Die robots.txt ist ein freiwilliger Standard. OpenAI, Anthropic und Google-Extended halten sich zuverlässig daran, bei Perplexity und Bots, die unter dem Radar laufen, ist das nicht garantiert. Für verbindliche Kontrolle brauchst du serverseitige Maßnahmen (siehe nächster Abschnitt). Ob deine robots.txt bei den einzelnen KI-Bots tatsächlich greift, kannst du mit unserem kostenlosen KI-Bot-Check prüfen: Das Tool testet den Zugriff von GPTBot, ClaudeBot, PerplexityBot und weiteren Bots gegen deine robots.txt und Serverconfig.
Serverseitig blockieren: Cloudflare, Reverse-IP und Fingerprinting
Ergänzend zum Video: Wo die robots.txt an Grenzen stößt, hilft die Server-Ebene. Drei Bausteine:
- Reverse-IP-Lookup: Prüft, ob eine anfragende IP wirklich zum angegebenen Bot gehört. So entlarvst du gefälschte User Agents, die sich als bekannter Bot ausgeben.
- Fingerprinting (z.B. über Cloudflare): Erkennt AI-Agenten an Verhaltensmustern, etwa an der Zugriffsgeschwindigkeit, auch wenn sie eine normale Browser-Kennung nutzen. Wichtig zu wissen: Cloudflare hat am 1. Juli 2025 begonnen, AI-Crawler für neue Domains per Default zu blockieren; bei neuen Projekten ist die AI-Bot-Detection also aktiv und muss bewusst deaktiviert werden, wenn du Zugriff erlauben willst. Parallel gibt es das Pay-per-Crawl-Modell.
- Rate-Limiting: Deckelt die Zugriffsfrequenz und schützt so vor volatilen Bot-Peaks, die den Server überlasten.
Google-Extended lässt sich serverseitig nicht einzeln sperren, weil es serverseitig nur den Googlebot gibt; hier bleibt die robots.txt das Mittel der Wahl.
Server-Logs auswerten: die wichtigste Datenquelle für AI Search
Ergänzend zum Video vertiefen wir den aus unserer Sicht wichtigsten Punkt. So gehst du vor:
- Logfiles beschaffen und filtern: Ziehe die Server-Logs und filtere nach den User-Agent-Tokens aus der Tabelle oben. Schon der Blick, welcher Bot wie oft zugreift, deckt Muster auf.
- Grounding-Requests identifizieren: User-getriggerte Aufrufe (z.B.
ChatGPT-User,Claude-User) zeigen, welche Inhalte KI-Systeme für echte Nutzerfragen heranziehen. Das ist ein Abbild des realen Nutzerinteresses. - Crawl-Fallen erkennen: Achte auf stark abgefragte APIs, abgelaufene Produkt-Detail-Seiten und 404-URLs. Entscheide je Fall: Redirect, Inhalte wiederherstellen oder blockieren.
- Prompt-Tracking erst danach: Ein reines Prompt-Tracking ist verzerrt (selbsterfüllende Prophezeiung). Nutze die Logs als Grundlage, um die wirklich relevanten Prompts abzuleiten.
Weil es aktuell keine einzelne Quelle für die KI-Sichtbarkeit gibt, kombinierst du mehrere Datenpunkte, und die Server-Logs stehen dabei an erster Stelle. Wie du Server-Logs vollständig auswertest, um deine KI-Sichtbarkeit zu messen, zeigt Logfile-Analyse für AI Search. Und wie du das damit verbundene Crawl-Budget effizient haltest, ohne aufwendige Logfiles, über die Crawling-Statistiken der Google Search Console, liest du auf Crawl-Budget optimieren.
Technische Basics für LLM-Sichtbarkeit: HTML, JavaScript und Semantik
Ergänzend zum Video die konkreten Stellschrauben, damit deine Inhalte für AI-Crawler überhaupt nutzbar sind:
- Inhalte im initialen HTML: AI-Trainer führen kein JavaScript aus. Alles Wichtige muss serverseitig gerendert im Quelltext stehen, nicht erst clientseitig nachgeladen werden.
- Semantik und sprechende Attribute: Sauberer, semantischer Code und aussagekräftige Attribute helfen besonders dem Agentic Browsing. Das deckt sich mit den Prinzipien der Barrierefreiheit.
-
Bing NoArchive prüfen: Das Meta-Tag
<meta name="robots" content="noarchive">steuert bei Bing, ob Inhalte in Copilot-Antworten und für Training genutzt werden. Google unterstütztnoarchiveseit 2019 nicht mehr, bei Bing ist es seit dem Update Anfang 2026 wieder relevant. Prüfe, ob du es ungewollt gesetzt hast, oder setze es bewusst ein.
Wichtige Fragen rund um AI Crawler und LLM-Bots
Sollte ich AI Crawler blocken oder zulassen?
Nicht pauschal. Entscheide getrennt nach Ziel: Das Crawling für die KI-Suche (Grounding) solltest
du in der Regel zulassen, weil davon deine Sichtbarkeit in KI-Antworten abhängt. Beim Training und bei
exklusiven Inhalten kannst du gezielt einschränken. Praktisch heißt das: Trainings-Bots wie
GPTBot oder ClaudeBot per robots.txt einschränken, Such-Bots wie
OAI-SearchBot zulassen. Details im Abschnitt zur Entscheidung nach Bot-Typ.
Wie blockiere ich AI Crawler in der robots.txt?
Du legst pro Bot einen User-agent-Block mit Disallow: / an und stellst die
Datei ins Root-Verzeichnis deiner Domain. Ein vollständiges, kopierbares Beispiel, das Training
einschränkt und die KI-Suche zulässt, findest du oben im Abschnitt „AI Crawler per robots.txt steuern“.
Beachte: Die robots.txt wirkt nur bei Bots, die sich daran halten.
Halten sich AI Crawler an die robots.txt?
Teilweise. OpenAI, Anthropic und Google-Extended respektieren die robots.txt zuverlässig; bei blockierenden Domains ist dort über längere Zeiträume keine Crawl-Aktivität feststellbar. Perplexity dagegen greift über wechselnde User-Agent-Strings und IP-Kreise trotzdem zu. Wenn du verbindliche Kontrolle brauchst, kombiniere die robots.txt mit serverseitigen Maßnahmen wie Reverse-IP-Lookup und Fingerprinting.
Was ist der Unterschied zwischen Training-Bots und Grounding-Bots?
Training-Bots (z.B. GPTBot, ClaudeBot) crawlen konstant und sammeln Inhalte
fürs Modelltraining. Grounding-Bots (z.B. ChatGPT-User) werden durch einen Nutzer-Prompt
ausgelöst und holen aktuelle Inhalte für eine konkrete Antwort. Praktisch relevant: Grounding-Zugriffe
in den Server-Logs sind ein Abbild echten Nutzerinteresses und der beste Startpunkt, um deine
KI-Sichtbarkeit zu verstehen. Mehr dazu im Abschnitt zu den Server-Logs.
Wie erkenne ich AI-Bots in den Server-Logs?
Über die User-Agent-Strings, siehe die Tabelle der wichtigsten AI-Crawler. Für Sicherheit gegen gefälschte Kennungen gleichst du die IP per Reverse-Lookup ab. Schwer bleiben Agenten, die über Headless Browser mit normaler Browser-Kennung kommen; die erkennst du am ehesten über Fingerprinting-Services. Praktischer erster Schritt: nach den bekannten Tokens filtern und Zugriffsmuster je Bot auswerten.
Können AI Crawler die Server-Performance beeinträchtigen?
Ja. Nicht der einzelne Request ist das Problem, sondern die volatilen Peaks: AI-Bots crawlen sehr ungleichmäßig und können Server bis zu Downtimes oder langen Ladezeiten belasten. Gegenmaßnahmen sind Rate-Limiting, ausreichende Serverkapazitäten für Spitzen und die Prüfung, ob dein Hoster AI-Bots bereits per Default blockiert. Details im Abschnitt zur Performance.