Crawl-Budget optimieren mit der Google Search Console
Crawl-Budget klingt nach einem Thema nur für Riesen-Websites, doch schon ein technischer Fehler wie eine Filternavigation macht aus 1.000 URLs schnell eine Million. Wer sein Crawl-Budget optimieren will, braucht aber nicht zwingend die aufwendige Server-Log-Analyse. Im eingebetteten Video zeigt SEOSOON-Mitgründerin Juliane Bettinga im SEOPRESSO-Livestream (Kanal SISTRIX) die „Logfile light“-Methode: Wie du mit den versteckten Crawling-Statistiken der Google Search Console ineffizientes Crawling erkennst und gezielt behebst. Darunter findest du das bereinigte Transkript, eine Zusammenfassung und einen ausführlichen Praxisteil mit Schritt-für-Schritt-Anleitung, Use Cases und FAQ.
Diese Seite behandelt die Crawl-Budget-Optimierung über die GSC-Crawling-Statistiken. Für die vollständige Server-Log-Analyse siehe Logfile-Analyse für AI Search, für das gezielte Blocken und Zulassen von AI-Crawlern siehe AI Crawler steuern.
Warum du dein Crawl-Budget optimieren solltest
Ergänzend zum Video: Crawl-Budget ist die Menge an URLs, die eine Suchmaschine in einem bestimmten Zeitraum auf deiner Seite crawlt. Sie ergibt sich aus Crawling-Kapazität (was dein Server hergibt) und Crawling-Bedarf (wie wichtig und aktuell deine Inhalte sind). Verschwendest du dieses Budget, hat das drei Folgen:
Neue URLs werden zu spät entdeckt und indexiert, kritisch für aktualitätsgetriebene Bereiche wie News und Publishing.
Änderungen an bestehenden Seiten erkennt Google später.
Unnötiges Crawling belastet den Server bis hin zu Ausfallzeiten und verursacht Kosten sowie einen vermeidbaren CO2-Abdruck.
Ein Crawl-Budget-Thema ist nicht nur etwas für Millionen-URL-Seiten. Faceted bzw. Filternavigation, Kalender oder Parameter-URLs blähen das Inventar auch bei kleinen Websites schnell auf.
Logfile light: Crawl-Budget über die GSC-Crawling-Statistiken analysieren
Ergänzend zum Video die Schritt-für-Schritt-Anleitung. Voraussetzung ist eine Domain-Property in der Google Search Console (die Crawling-Statistiken fehlen bei Folder-Properties). Du findest den Bericht unter Einstellungen → Crawling-Statistiken. Eine ausführlichere, allgemeinere Anleitung zur Methode selbst findest du auch auf unserer Seite Logfile-Analyse Light » Anleitung und Tipps.
- Daten holen: Die GSC bietet vier Aufschlüsselungen: nach Dateityp, nach Zweck (Discovery/Refresh), nach Antwort (Statuscode) und nach Googlebot-Typ, mit jeweils bis zu 1.000 Beispiel-URLs. Das sind bis zu 45 Exporte. Das Chrome-Plugin von Valentin Pletzer lädt sie mit einem Klick gebündelt herunter.
- Aggregieren: Die Berichte konsolidieren und den URL-Pfad zerlegen, um Verzeichnisanalysen zu ermöglichen. Juliane nutzt dafür ein Master-Template in Google Sheets (oder n8n), ein Apps-Script führt die Daten zusammen.
- Visualisieren: Die Master-Datei an Looker Studio anbinden. Danach kannst du direkt nach Auffälligkeiten suchen.
Der CSV-Export der Crawling-Statistiken ist auf 1.000 Zeilen limitiert, es gibt keine API. Der einzige Weg zu mehr Daten ist, alle Teilberichte zu ziehen und zu aggregieren. Wer die komplette Tiefe braucht, macht zusätzlich eine echte Server-Log-Analyse.
Worauf du in den Crawling-Statistiken achtest
Ergänzend zum Video die Prioritäten für die Auswertung:
- Statuscode-Verteilung: Statuscode 200 sollte klar überwiegen, Ziel etwa 95 Prozent. Hohe Anteile an 301 oder 404, die du nicht erklären kannst, sind ein Warnsignal (im Video: Parameter-URLs als 23 Prozent des Crawlings).
- Dateityp-Verteilung: Überwiegt HTML, oder frisst JavaScript, CSS, PDF oder Bilder unverhältnismäßig viel Crawling? Das deckt technische Probleme auf.
- Discovery gegen Refresh: Passt der Discovery-Anteil zur Veröffentlichungsfrequenz eines Verzeichnisses?
- Verzeichnis-Segmentierung: Welche Verzeichnisse werden am häufigsten gecrawlt, und ist das gerechtfertigt?
- Top-URLs gegen Traffic: Sind unter den meistgecrawlten URLs auch deine Trafficbringer, oder eher irrelevante Seiten? Ein Hinweis auf die interne Verlinkung.
- Peaks und Serverantwortzeit: Steigen Crawl-Requests und Reaktionszeit parallel? Dann drohen Kapazitätsprobleme.
Wer beim Blick in die Crawling-Statistiken auf Muster stößt, die sich nicht einordnen lassen, kann uns gerne kontaktieren. Mehr zu strukturellen Crawling- und Indexierungsthemen findest du auch auf unserer Seite Technisches SEO » Crawling, Indexierung, CWV und mehr.
Crawl-Budget optimieren: die wichtigsten Hebel
Ergänzend zum Video die konkreten Maßnahmen, wenn du Crawl-Ballast findest:
- Technische Fehler beheben: Faceted bzw. Filternavigation, Kalender und ungewollte Parameter-URLs erzeugen riesige URL-Mengen. Das ist die häufigste Ursache.
- Per robots.txt aussperren: Notwendige, aber crawlingunwürdige Verzeichnisse blockieren. Achtung: gesperrte URLs können als „indexiert, obwohl durch robots.txt gesperrt“ auftauchen, dann zusätzlich die internen Links maskieren oder entfernen.
- Redirect-Ketten abbauen: Gerade bei Republishing entstehen fünf bis zehn Ketten, möglichst automatisiert auflösen.
- Korrekte Statuscodes: 410 statt 404 für dauerhaft gelöschte Inhalte (bis zu 50 Prozent weniger Crawling), 304 (Not Modified) für unveränderte Seiten.
- Website-Architektur: Wichtige, in der Sitemap gelistete Inhalte gut intern verlinken, nicht in Klicktiefe acht vergraben.
-
Page-Performance: Ladegeschwindigkeit und Server-Antwortzeit optimieren, dazu eine
saubere, aktuelle Sitemap mit
<lastmod>.
Ein großer Teil des ungewollten Crawlings stammt heute auch von AI-Bots. Wie du deren Zugriff gezielt steuerst, zeigt die Seite AI Crawler steuern.
Use Case: eine Migration mit den Crawling-Statistiken überwachen
Ergänzend zum Video das Vorgehen bei einer URL-Migration:
- Status quo sichern: Vorab die aktuelle Verteilung festhalten. Die GSC speichert die Daten drei Monate rückwirkend, du kannst also auch direkt nach der Migration noch zurückblicken.
- 301 beobachten: Nach der Umleitung sollte das Crawling im Bereich 301 deutlich steigen.
- 404 im Blick behalten: Steigen die 404-Anteile stark, sind vielleicht Inhalte verloren gegangen. Das 404-Crawling sollte sich mit der Zeit einpegeln, sonst auf 410 umstellen.
- Dateitypen prüfen: Wird plötzlich mehr JavaScript oder CSS gecrawlt, war das eine gewollte Template-Änderung?
Häufige Fragen zur Crawl-Budget-Optimierung
Was ist Crawl-Budget?
Crawl-Budget ist die Menge an URLs, die eine Suchmaschine in einem bestimmten Zeitraum auf deiner Seite crawlt. Es setzt sich aus der Crawling-Kapazität (Serverleistung) und dem Crawling-Bedarf (Wichtigkeit und Aktualität der Inhalte) zusammen. Praktisch relevant wird es, wenn dein URL-Inventar deutlich größer ist als die Zahl deiner wirklich wichtigen Seiten.
Muss sich nur eine große Website um Crawl-Budget kümmern?
Nein. Auch kleine Websites bekommen ein Crawl-Budget-Thema, wenn technische Fehler das Inventar aufblähen, etwa eine Filternavigation, die aus 1.000 URLs eine Million macht. Ein kurzer Blick in die Crawling-Statistiken lohnt sich für jeden.
Wo finde ich die Crawling-Statistiken in der Search Console?
Unter Einstellungen → Crawling-Statistiken, und nur mit einer Domain-Property, nicht mit einer Folder-Property. Auf Domain-Ebene sind alle Subdomains im Hosts-Bericht enthalten (bis zu 20, 90 Tage). Details in der Schritt-für-Schritt-Anleitung oben.
Wie optimiere ich mein Crawl-Budget konkret?
Behebe zuerst technische Ursachen (Filternavigation, Parameter-URLs), sperre unnötige Verzeichnisse per robots.txt, baue Redirect-Ketten ab, nutze 410 statt 404 für gelöschte Inhalte und 304 für unveränderte Seiten, verlinke wichtige Inhalte gut intern und halte die Sitemap aktuell. Mehr im Abschnitt zu den wichtigsten Hebeln.
Warum sind Logfiles besser als ein normaler Crawler?
Ein Crawler wie Screaming Frog zeigt höchstens das letzte Crawldatum, nicht die Crawl-Frequenz, nicht ob URLs gar nicht gecrawlt werden und nicht, in welchen Ressourcen sich Suchmaschinen festbeissen. Diese Frequenz siehst du nur in Logfiles oder, als leichte Alternative, in den GSC-Crawling-Statistiken. Für die volle Tiefe siehe die Server-Log-Analyse.
Wie hole ich mehr als 1.000 Zeilen aus den Crawling-Statistiken?
Gar nicht direkt, der Export ist limitiert und es gibt keine API. Der Weg zu mehr Aussagekraft ist, alle vier Teilberichte (Dateityp, Zweck, Antwort, Googlebot-Typ) zu ziehen und zu aggregieren, wofür sich das Chrome-Plugin von Valentin Pletzer und ein Template plus Looker Studio eignen.