Logfile-Analyse für SEO und AI Search: AI-Bots erkennen und KI-Sichtbarkeit messen
Wer bei ChatGPT und Co. sichtbar sein will, denkt zuerst an Content. Dabei entscheidet sich viel schon eine Ebene tiefer: Kann ein AI Crawler deine Seite überhaupt erreichen, und was passiert dort? Die ehrlichste Antwort darauf steht in deinen Server-Logs. Im eingebetteten Video spricht SEOSOON-Mitgründerin Juliane Bettinga im Search-Camp-Podcast mit Markus Hövener über die technischen Barrieren des AI Crawlings und darüber, warum die Logfile-Analyse aktuell die verlässlichste Datenquelle ist, um die eigene KI-Sichtbarkeit zu messen. Darunter findest du das bereinigte Transkript, eine Zusammenfassung und einen ausführlichen Praxisteil zu Logfile-Analyse, AI-Bot-Erkennung, JavaScript und Server-Performance.
Diese Seite behandelt die Diagnose per Logfile-Analyse. Wie du AI Crawler gezielt blockst oder zulässt (robots.txt, serverseitige Steuerung), liest du auf unserer Seite AI Crawler steuern.
Kann ein AI Crawler deine Seite überhaupt erreichen?
Ergänzend zum Video die praktische Prüfung. Bevor du an Content denkst, kläre die Erreichbarkeit. Typische Barrieren:
Hoster, CDN oder Firewall blockieren AI-Bots, oft unbemerkt bei kleinen und mittleren Websites. Anzeichen sind Rate Limits oder ein Status 403 direkt bei den ersten Zugriffen.
Die bewusste Steuerung. Achtung, sie wirkt nicht rückwirkend: Wer blockiert, kann trotzdem noch in AI-Antworten auftauchen, weil er in Trainingsdaten steckt oder referenziert wird.
Ein altes <meta name="robots" content="noarchive"> signalisiert Bing, die
Seite nicht in Copilot-Antworten oder fürs Training zu nutzen. Die Bing Webmaster Tools melden
das als Recommendation.
Wichtige, per JavaScript nachgeladene Inhalte sind für AI-Bots oft unsichtbar.
Ob AI-Bots wie GPTBot, ClaudeBot oder PerplexityBot auf deine Seite zugreifen können, prüfst du am schnellsten mit unserem kostenlosen KI-Bot-Check, dem Tool, das Juliane im Video erwähnt. Wie du die einzelnen Bots danach gezielt blockst oder zulässt, zeigt die Seite AI Crawler steuern.
Logfile-Analyse: was Server-Logs sind und wie du drankommst
Ergänzend zum Video die Grundlagen. Server-Logs sind Protokolldateien, die jeden Request an deinen Server festhalten, mit Zeitstempel, angefragter URL, Statuscode, IP und User Agent. So gehst du vor:
- Logfiles beschaffen: In der Regel stellt der Hoster sie bereit. Bei kleinen bis mittleren Websites ziehst du sie meist über einen SFTP-Zugang oder als Export.
- Zeitraum wählen: Für den Einstieg reichen 14 Tage, um zu sehen, was wie häufig gecrawlt wird.
- Datenschutz beachten: IP-Adressen sind personenbezogene Daten. Anonymisiere oder kürze sie und lösche Logs nach einer definierten Frist (DSGVO).
- Auswerten mit Tool: Die Datenmengen sind groß, ein reiner Texteditor reicht nicht. Es braucht ein Analyse-Tool (siehe unten).
AI-Bots in den Logfiles erkennen
Ergänzend zum Video: In den Logs identifizierst du die Bots über den User Agent. Für die KI-Sichtbarkeit sind vor allem die Grounding-Bots interessant, weil sie user-getriggert sind und echtes Nutzerinteresse abbilden. Die wichtigsten Kennungen:
| User-Agent-Token | Anbieter | Typ |
|---|---|---|
GPTBot | OpenAI | Training |
ChatGPT-User | OpenAI | Grounding (user-getriggert) |
OAI-SearchBot | OpenAI | Suche |
ClaudeBot | Anthropic | Training |
Claude-User | Anthropic | Grounding (user-getriggert) |
PerplexityBot | Perplexity | Suchindex |
Google-Extended | Gemini-Training/Grounding | |
Bingbot | Microsoft | Suche/Copilot |
Für belastbare Ergebnisse gleichst du die IP per Reverse-Lookup ab. Agenten mit normaler Browser-Kennung (etwa manche Perplexity-Zugriffe) tauchen so gar nicht sauber auf. Eine ausführliche User-Agent-Übersicht und die robots.txt-Steuerung findest du auf AI Crawler steuern.
Was du aus Logfiles für AI Search lernst
Ergänzend zum Video die konkreten Auswertungen, die sich lohnen:
- Grounding-URLs finden: Welche Seiten werden von user-getriggerten Bots
(
ChatGPT-User,Claude-User) am häufigsten abgerufen? Dort steckt echtes Nutzerinteresse, das ist dein Sichtbarkeits-Indikator. - Nach Themen aggregieren: Fasse die Zugriffe nach Verzeichnissen, Produktgruppen oder Themen zusammen. So siehst du, welche Bereiche für LLMs relevant sind.
- Training gegen Grounding: Wird ein Bereich nur von Trainingsbots, aber nie im Grounding abgerufen, ist er für die aktuelle KI-Sichtbarkeit unwichtig. Das ist kein Beinbruch, es zählt der richtige Kanal.
- Von Erfolgen lernen: Was im Grounding gut läuft und Klicks oder Conversions bringt (Abgleich mit GA4), lässt sich auf andere wichtige Seiten adaptieren.
- Prompts annähern: Die echten Prompts siehst du nicht. Aber zu den stark genutzten URLs liefern die Longtail-Begriffe aus der Search Console Hinweise auf die relevanten Fragestellungen.
Ein Grounding-Zugriff heißt nur, dass deine Seite ins Relevanzset (Query Fan-out) gekommen ist, nicht, dass du in der Antwort zitiert wirst.
Tools für die Logfile-Analyse
Ergänzend zum Video ein Überblick über die Werkzeuge:
- Screaming Frog Log File Analyser: günstiger, einfacher Einstieg. Ideal, um ohne großen Aufwand loszulegen, für die AI-spezifische Auswertung aber nicht vollständig.
- KI-Bot-Checker: prüfen im Bulk, ob AI-Bots überhaupt zugreifen dürfen (etwa unser KI-Bot-Check). Das ist die Erreichbarkeits-, nicht die Logfile-Auswertung, aber der logische erste Schritt.
- Screaming Frog SEO Spider: zum manuellen Testen einzelner Bots, der User Agent lässt sich wechseln, die AI-Bots sind hinterlegt. Jeder Bot muss einzeln geprüft werden.
- Eigene Auswertung: Server-Logs folgen einer einheitlichen Struktur und lassen sich gut selbst parsen, gerade mit AI-Tools, bis hin zu einem eigenen Agenten, der auffällige URLs analysiert.
JavaScript und Server-Performance als Crawling-Barrieren
Ergänzend zum Video die zwei technischen Dauerbrenner:
- JavaScript: Prüfe mit dem Screaming Frog oder einem Chrome-Plugin (JavaScript deaktivieren), was per JavaScript nachgeladen wird. Nicht jede weiße Seite ist ein JS-Problem, oft fehlt nur das CSS. Lösung: Server-Side Rendering oder die wichtigsten Inhalte ins Raw-HTML.
- Server-Performance: Grüne Core Web Vitals sind ein guter Indikator, aber kein Freifahrtschein. Beobachte die Time to First Byte über ein Server-Monitoring, die Crawling-Statistiken der Search Console haben drei Tage Verzug. Bei Shared Hosting mit hoher AI-Crawl-Last lohnt ein Blick auf das Hosting-Paket. Wie du dein Crawl-Budget insgesamt effizienter gestaltest und ineffizientes Crawling über die Crawling-Statistiken der Google Search Console findest, zeigt Crawl-Budget optimieren.
Wichtige Fragen zur Logfile-Analyse für AI Search
Was ist eine Logfile-Analyse?
Die Logfile-Analyse wertet die Protokolldateien deines Servers aus, in denen jeder Request festgehalten wird. Für SEO und AI Search zeigt sie, welche Bots wann welche URLs abgerufen haben. Praktisch: Du ziehst die Logs beim Hoster, wertest sie mit einem Tool aus und filterst nach den User Agents der AI-Bots. Details im Abschnitt zu den Grundlagen oben.
Wie komme ich an meine Server-Logs?
In der Regel stellt der Hoster sie bereit. Bei kleinen bis mittleren Websites ziehst du sie über einen SFTP-Zugang oder als Export aus dem Hosting-Panel. Achte auf den Datenschutz: IP-Adressen sind personenbezogen, also anonymisieren und Logs nach Frist löschen.
Womit werte ich Logfiles aus?
Für den Einstieg eignet sich der günstige Screaming Frog Log File Analyser. Wer AI-spezifisch auswerten will, baut sich eine eigene Auswertung, die Logs folgen einer einheitlichen Struktur und lassen sich gut parsen, gerade mit AI-Tools. Ob AI-Bots überhaupt zugreifen dürfen, klärst du vorab mit einem KI-Bot-Checker.
Wie messe ich meine Sichtbarkeit in LLMs über Logfiles?
Filtere die Grounding-Bots (z.B. ChatGPT-User) und schaue, welche URLs am häufigsten
abgerufen werden, das ist ein Indikator für echtes Nutzerinteresse. Aggregiere nach Themen und
gleiche mit Klick- und Conversion-Daten aus GA4 ab. Beachte: Ein Zugriff heißt, du bist ins
Relevanzset gekommen, nicht zwingend, dass du in der KI-Antwort zitiert wirst.
Sehe ich in den Logfiles die konkreten Prompts?
Nein. Du siehst nur, welche URLs zur Beantwortung genutzt wurden, nicht den Prompt selbst. Du kannst dich annähern: Zu den stark genutzten URLs liefern die Longtail-Suchbegriffe aus der Search Console Hinweise auf die relevanten Fragestellungen. Als Ergänzung zeigt der Bing AI Performance Report Grounding-Queries, deckt aber nur einen Bruchteil ab.
Reichen grüne Core Web Vitals für AI-Crawler?
Nicht unbedingt. Selbst bei guten Core Web Vitals kann der Server unter den volatilen Crawl-Peaks der AI-Bots einbrechen. Beobachte die Time to First Byte über ein Server-Monitoring, die Crawling-Statistiken der Search Console sind mit drei Tagen Verzug zu träge fürs kurzfristige Monitoring.