Video: „LLM Bot Crawling: Blocken, zulassen oder strategisch steuern?“ mit Juliane Bettinga (SEOSOON), aus dem SEOPRESSO Podcast. Das Video stammt nicht von uns. Wir stellen es hier redaktionell vor, alle Rechte liegen beim Kanal.

AI Crawler steuern: LLM-Bots blocken oder zulassen?

Sollst du AI Crawler blocken oder zulassen? Diese Frage stellt sich fast jedes Unternehmen, seit LLM-Bots von OpenAI, Anthropic, Perplexity und Google in großem Umfang durchs Web ziehen. Die kurze Antwort: Es ist keine Schwarz-Weiß-Entscheidung. Im eingebetteten Video erklärt SEOSOON-Geschäftsführerin Juliane Bettinga im SEOPRESSO Podcast mit Björn, wie du AI Crawler differenziert nach Bot-Typ steuerst, welche Rolle robots.txt und serverseitige Maßnahmen spielen und warum Server-Logs zur wichtigsten Datenquelle für AI Search werden. Darunter findest du das bereinigte Transkript, eine Zusammenfassung und einen ausführlichen Praxisteil mit robots.txt-Beispiel, User-Agent-Tabelle und FAQ.

AI Crawler blocken oder zulassen: eine Entscheidung nach Bot-Typ

Ergänzend zum Video haben wir die Entscheidungslogik als praktische Anleitung aufbereitet. Trenne zuerst die drei Ziele, um die es beim AI Crawling geht, sie lassen sich getrennt steuern:

Training

Deine Inhalte fließen in Modelle ein: oft der Bereich, den man am ehesten einschränkt, vor allem bei exklusiven Inhalten.

Grounding / KI-Suche

Deine Inhalte werden für konkrete Nutzerfragen herangezogen: hier bringt Zulassen Sichtbarkeit in KI-Antworten.

Agenten-Traffic

Agenten führen im Auftrag von Nutzern Aktionen aus: am schwersten zu erkennen, weil über Headless Browser getarnt.

Als Faustregel: Grounding-/Such-Bots eher zulassen, Trainings-Zugriff und schützenswerte Verzeichnisse bewusst steuern, Agenten und Missbrauch serverseitig im Blick behalten.

Die wichtigsten AI-Crawler und ihre User-Agents

Ergänzend zum Video: Diese Übersicht der gängigen AI-Crawler hilft beim Erkennen in den Server-Logs und beim Formulieren der robots.txt. Die Namen sind die offiziellen User-Agent-Tokens der Anbieter (Stand der Recherche: August 2026, Angaben der Anbieter können sich ändern).

Anbieter User-Agent-Token Zweck
OpenAIGPTBotTraining der Modelle
OpenAIOAI-SearchBotIndexierung für die ChatGPT-Suche
OpenAIChatGPT-UserUser-getriggerte Aufrufe (Grounding)
AnthropicClaudeBotTraining der Modelle
AnthropicClaude-UserUser-getriggerte Aufrufe
AnthropicClaude-SearchBotIndexierung für die Suche
GoogleGoogle-ExtendedGemini/Vertex-Training und Grounding, ohne Einfluss auf das Such-Ranking
PerplexityPerplexityBotAufbau des Suchindex
PerplexityPerplexity-UserUser-getriggert; hält sich laut Berichten nicht zuverlässig an die robots.txt
MicrosoftBingbotSuche und Copilot (über NoArchive steuerbar)
Common CrawlCCBotöffentlicher Datensatz, den viele KI-Modelle nutzen
ByteDanceBytespiderTraining; oft hohes Crawl-Volumen
MetaMeta-ExternalAgentTraining und KI-Produkte von Meta
AmazonAmazonbotAlexa/KI-Dienste (reagiert auf NoArchive)

AI Crawler per robots.txt steuern: Beispiel

Ergänzend zum Video zeigen wir, wie eine robots.txt aussieht, die Training einschränkt, aber die KI-Suche zulässt. Die robots.txt gehört ins Root-Verzeichnis (https://deine-domain.de/robots.txt). Passe die Auswahl an deine Strategie an.

# Training einschraenken
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Bytespider
Disallow: /

# KI-Suche und user-getriggerte Aufrufe zulassen
User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Claude-SearchBot
Allow: /

Wichtig: Die robots.txt ist ein freiwilliger Standard. OpenAI, Anthropic und Google-Extended halten sich zuverlässig daran, bei Perplexity und Bots, die unter dem Radar laufen, ist das nicht garantiert. Für verbindliche Kontrolle brauchst du serverseitige Maßnahmen (siehe nächster Abschnitt). Ob deine robots.txt bei den einzelnen KI-Bots tatsächlich greift, kannst du mit unserem kostenlosen KI-Bot-Check prüfen: Das Tool testet den Zugriff von GPTBot, ClaudeBot, PerplexityBot und weiteren Bots gegen deine robots.txt und Serverconfig.

Serverseitig blockieren: Cloudflare, Reverse-IP und Fingerprinting

Ergänzend zum Video: Wo die robots.txt an Grenzen stößt, hilft die Server-Ebene. Drei Bausteine:

  • Reverse-IP-Lookup: Prüft, ob eine anfragende IP wirklich zum angegebenen Bot gehört. So entlarvst du gefälschte User Agents, die sich als bekannter Bot ausgeben.
  • Fingerprinting (z.B. über Cloudflare): Erkennt AI-Agenten an Verhaltensmustern, etwa an der Zugriffsgeschwindigkeit, auch wenn sie eine normale Browser-Kennung nutzen. Wichtig zu wissen: Cloudflare hat am 1. Juli 2025 begonnen, AI-Crawler für neue Domains per Default zu blockieren; bei neuen Projekten ist die AI-Bot-Detection also aktiv und muss bewusst deaktiviert werden, wenn du Zugriff erlauben willst. Parallel gibt es das Pay-per-Crawl-Modell.
  • Rate-Limiting: Deckelt die Zugriffsfrequenz und schützt so vor volatilen Bot-Peaks, die den Server überlasten.

Google-Extended lässt sich serverseitig nicht einzeln sperren, weil es serverseitig nur den Googlebot gibt; hier bleibt die robots.txt das Mittel der Wahl.

Server-Logs auswerten: die wichtigste Datenquelle für AI Search

Ergänzend zum Video vertiefen wir den aus unserer Sicht wichtigsten Punkt. So gehst du vor:

  1. Logfiles beschaffen und filtern: Ziehe die Server-Logs und filtere nach den User-Agent-Tokens aus der Tabelle oben. Schon der Blick, welcher Bot wie oft zugreift, deckt Muster auf.
  2. Grounding-Requests identifizieren: User-getriggerte Aufrufe (z.B. ChatGPT-User, Claude-User) zeigen, welche Inhalte KI-Systeme für echte Nutzerfragen heranziehen. Das ist ein Abbild des realen Nutzerinteresses.
  3. Crawl-Fallen erkennen: Achte auf stark abgefragte APIs, abgelaufene Produkt-Detail-Seiten und 404-URLs. Entscheide je Fall: Redirect, Inhalte wiederherstellen oder blockieren.
  4. Prompt-Tracking erst danach: Ein reines Prompt-Tracking ist verzerrt (selbsterfüllende Prophezeiung). Nutze die Logs als Grundlage, um die wirklich relevanten Prompts abzuleiten.

Weil es aktuell keine einzelne Quelle für die KI-Sichtbarkeit gibt, kombinierst du mehrere Datenpunkte, und die Server-Logs stehen dabei an erster Stelle. Wie du Server-Logs vollständig auswertest, um deine KI-Sichtbarkeit zu messen, zeigt Logfile-Analyse für AI Search. Und wie du das damit verbundene Crawl-Budget effizient haltest, ohne aufwendige Logfiles, über die Crawling-Statistiken der Google Search Console, liest du auf Crawl-Budget optimieren.

Technische Basics für LLM-Sichtbarkeit: HTML, JavaScript und Semantik

Ergänzend zum Video die konkreten Stellschrauben, damit deine Inhalte für AI-Crawler überhaupt nutzbar sind:

  • Inhalte im initialen HTML: AI-Trainer führen kein JavaScript aus. Alles Wichtige muss serverseitig gerendert im Quelltext stehen, nicht erst clientseitig nachgeladen werden.
  • Semantik und sprechende Attribute: Sauberer, semantischer Code und aussagekräftige Attribute helfen besonders dem Agentic Browsing. Das deckt sich mit den Prinzipien der Barrierefreiheit.
  • Bing NoArchive prüfen: Das Meta-Tag <meta name="robots" content="noarchive"> steuert bei Bing, ob Inhalte in Copilot-Antworten und für Training genutzt werden. Google unterstützt noarchive seit 2019 nicht mehr, bei Bing ist es seit dem Update Anfang 2026 wieder relevant. Prüfe, ob du es ungewollt gesetzt hast, oder setze es bewusst ein.

Wichtige Fragen rund um AI Crawler und LLM-Bots

Sollte ich AI Crawler blocken oder zulassen?

Nicht pauschal. Entscheide getrennt nach Ziel: Das Crawling für die KI-Suche (Grounding) solltest du in der Regel zulassen, weil davon deine Sichtbarkeit in KI-Antworten abhängt. Beim Training und bei exklusiven Inhalten kannst du gezielt einschränken. Praktisch heißt das: Trainings-Bots wie GPTBot oder ClaudeBot per robots.txt einschränken, Such-Bots wie OAI-SearchBot zulassen. Details im Abschnitt zur Entscheidung nach Bot-Typ.

Wie blockiere ich AI Crawler in der robots.txt?

Du legst pro Bot einen User-agent-Block mit Disallow: / an und stellst die Datei ins Root-Verzeichnis deiner Domain. Ein vollständiges, kopierbares Beispiel, das Training einschränkt und die KI-Suche zulässt, findest du oben im Abschnitt „AI Crawler per robots.txt steuern“. Beachte: Die robots.txt wirkt nur bei Bots, die sich daran halten.

Halten sich AI Crawler an die robots.txt?

Teilweise. OpenAI, Anthropic und Google-Extended respektieren die robots.txt zuverlässig; bei blockierenden Domains ist dort über längere Zeiträume keine Crawl-Aktivität feststellbar. Perplexity dagegen greift über wechselnde User-Agent-Strings und IP-Kreise trotzdem zu. Wenn du verbindliche Kontrolle brauchst, kombiniere die robots.txt mit serverseitigen Maßnahmen wie Reverse-IP-Lookup und Fingerprinting.

Was ist der Unterschied zwischen Training-Bots und Grounding-Bots?

Training-Bots (z.B. GPTBot, ClaudeBot) crawlen konstant und sammeln Inhalte fürs Modelltraining. Grounding-Bots (z.B. ChatGPT-User) werden durch einen Nutzer-Prompt ausgelöst und holen aktuelle Inhalte für eine konkrete Antwort. Praktisch relevant: Grounding-Zugriffe in den Server-Logs sind ein Abbild echten Nutzerinteresses und der beste Startpunkt, um deine KI-Sichtbarkeit zu verstehen. Mehr dazu im Abschnitt zu den Server-Logs.

Wie erkenne ich AI-Bots in den Server-Logs?

Über die User-Agent-Strings, siehe die Tabelle der wichtigsten AI-Crawler. Für Sicherheit gegen gefälschte Kennungen gleichst du die IP per Reverse-Lookup ab. Schwer bleiben Agenten, die über Headless Browser mit normaler Browser-Kennung kommen; die erkennst du am ehesten über Fingerprinting-Services. Praktischer erster Schritt: nach den bekannten Tokens filtern und Zugriffsmuster je Bot auswerten.

Können AI Crawler die Server-Performance beeinträchtigen?

Ja. Nicht der einzelne Request ist das Problem, sondern die volatilen Peaks: AI-Bots crawlen sehr ungleichmäßig und können Server bis zu Downtimes oder langen Ladezeiten belasten. Gegenmaßnahmen sind Rate-Limiting, ausreichende Serverkapazitäten für Spitzen und die Prüfung, ob dein Hoster AI-Bots bereits per Default blockiert. Details im Abschnitt zur Performance.

Wir freuen uns über
deine Kontaktaufnahme

[ameliacatalogbooking package=1]