Crawler

Robots txt Grafik

Bevor ein Mensch Ihre Website findet, war längst eine Maschine da. Jeden Tag rufen Programme Ihre Seiten auf, lesen Inhalte aus und melden sie an Suchmaschinen weiter. Diese Programme heißen Crawler. Laut dem Imperva Bad Bot Report 2025 verursachten Bots 2024 erstmals seit zehn Jahren mehr Traffic als Menschen. Ihr Anteil lag bei 51 Prozent des gesamten Webverkehrs. Ein Teil davon sind nützliche Webcrawler wie der Googlebot. Ein anderer Teil sammelt Daten für KI-Modelle oder kopiert Inhalte ungefragt.

Für Marketingverantwortliche ist das keine reine Technikfrage. Was ein Crawler nicht findet, erscheint weder bei Google noch in ChatGPT. Was er falsch versteht, rankt schlecht. In diesem Glossarbeitrag erklären wir, wie Crawling funktioniert und wie Sie die Crawlbarkeit Ihrer Website prüfen. Außerdem zeigen wir, welche KI-Crawler Sie zulassen sollten und bei welchen Sie besser genauer hinschauen.

Das Wichtigste in Kürze

  • Ein Crawler ist ein Programm, das Webseiten automatisch aufruft, Inhalte ausliest und Links zu weiteren URLs folgt.
  • Ohne Crawling keine Indexierung und ohne Indexierung kein Ranking in den Suchergebnissen.
  • Sie steuern Crawler über die robots.txt, Meta-Robots-Angaben wie noindex und XML-Sitemaps.
  • KI-Crawler wie GPTBot lesen meist kein JavaScript und liefern kaum Besucher zurück.

1. Was ist ein Crawler?

Ein Crawler ist ein Programm, das Webseiten automatisch aufruft, ihre Inhalte ausliest und Links zu weiteren URLs folgt. Suchmaschinen wie Google und Bing nutzen Crawler, um ihren Suchindex aufzubauen und aktuell zu halten. Gängige Synonyme sind Webcrawler, Spider, Searchbot oder einfach Bot. Der Begriff Spider beschreibt das Prinzip gut. Der Crawler bewegt sich wie eine Spinne von Faden zu Faden durch das Netz.

Für SEO hat der Crawler eine zentrale Bedeutung. Ohne Crawling gibt es keine Indexierung. Ohne Indexierung gibt es kein Ranking. Jede Optimierung von Content und Keywords läuft ins Leere, wenn der Crawler eine Seite nicht erreicht. Eine Webseite, die nie gecrawlt wird, bleibt für Suchmaschinen unsichtbar. Deshalb steht die technische Prüfung der Crawlbarkeit am Anfang jeder Suchmaschinenoptimierung. Gute SEO beginnt nicht beim Text, sondern beim Zugang für den Webcrawler.

Kurz erklärt

Crawling bedeutet, dass ein Bot eine Seite abruft und ihren Quellcode liest. Rendern heißt, dass er Skripte ausführt und die Seite so darstellt wie ein Browser. Bei der Indexierung speichert die Suchmaschine die Inhalte in ihrem Index. Erst danach kann eine Seite für Suchanfragen ranken.

2. Wie funktioniert Crawling? Der Prozess Schritt für Schritt

Jeder Crawler startet mit einer Liste bekannter Adressen. Diese stammen aus früheren Durchläufen, aus eingereichten Sitemaps oder aus Links anderer Domains. Im ersten Schritt schickt der Crawler eine Anfrage an den Server. Der Server antwortet mit einem HTTP-Statuscode. Der Code 200 bedeutet, dass die Seite erreichbar ist.

Im zweiten Schritt liest der Crawler den HTML-Code. Er erkennt Texte, Überschriften, Meta-Angaben und vor allem Links. Neue Links landen in seiner Warteschlange. So entdeckt er Unterseite für Unterseite. Der Googlebot rendert die Seite anschließend mit einer aktuellen Chromium-Version. Erst dann sieht er auch Inhalte, die per JavaScript nachgeladen werden. Dieses Rendern kann zeitversetzt erfolgen.

Im dritten Schritt folgt die Indexierung. Die Suchmaschine analysiert die Inhalte, erkennt Duplikate und entscheidet, ob eine Seite in den Index kommt. Nicht jede gecrawlte Seite wird auch indexiert. Die Algorithmen bewerten dabei Qualität, Relevanz und technische Signale. Erst im Index konkurriert eine Seite um gute Ergebnisse in den Suchergebnissen. Ob Suchmaschinen eine Seite indexieren, können Sie beeinflussen, aber nie erzwingen.

Crawl-Budget: Wann es für Unternehmen wichtig wird

Google crawlt nicht unbegrenzt. Wie viele Seiten ein Bot pro Domain abruft, hängt von Ihrem Server ab. Auch das Interesse der Suchmaschine an Ihren Inhalten spielt eine Rolle. Laut Google Search Central betrifft das Thema vor allem sehr große Websites. Gemeint sind Domains mit über einer Million URLs oder mit Zehntausenden täglichen Änderungen. Für die meisten Mittelständler ist das Crawl-Budget daher kein Engpass.

Ein typisches Beispiel zeigt trotzdem, wo es eng wird. Ein Onlineshop aus der Region bietet 800 Produkte an. Seine Filterfunktionen erzeugen aber über Parameter mehrere zehntausend URLs. Der Googlebot verbringt seine Zeit dann mit Varianten statt mit neuen Produktseiten. Die Lösung liegt in einer sauberen Struktur, gezielten Blockierungen und Canonical-Tags.

3. Crawler, Spider, Bot und Scraper im Vergleich

Die Begriffe werden häufig vermischt, auch in der SEO-Branche. Ein Bot ist jedes Programm, das automatisiert Aufgaben im Internet erledigt. Ein Crawler ist eine bestimmte Art von Bot. Er folgt systematisch Links und erfasst ganze Websites. Spider ist schlicht ein anderes Wort für Crawler. Webcrawler arbeiten im Auftrag von Suchmaschinen, SEO-Tools oder Archiven wie dem Internet Archive.

Ein Scraper verfolgt ein anderes Ziel. Er zieht gezielt bestimmte Daten aus Webseiten heraus, etwa Preise, Kontaktdaten oder ganze Texte. Web Scraping ist nicht automatisch illegal. Viele Scraper ignorieren aber die robots.txt und tarnen sich sogar als Googlebot. Ob ein Zugriff wirklich von Google kommt, prüfen Entwickler über einen Reverse-DNS-Abgleich. Google veröffentlicht dafür die IP-Bereiche seiner Crawler.

4. Die wichtigsten Crawler im Überblick

Für Ihre Sichtbarkeit zählen vor allem die Crawler der großen Suchmaschinen und KI-Anbieter. Ihre Funktionen unterscheiden sich deutlich. Die folgende Tabelle zeigt, welcher Bot welche Aufgaben übernimmt.

CrawlerAnbieterAufgabeWirkung auf Ihre Sichtbarkeit
Googlebot SmartphoneGoogleHauptcrawler der Google-SucheGrundlage für Rankings und AI Overviews
Googlebot DesktopGoogleErgänzender Crawler für Desktop-AnsichtenNachrangig seit Mobile First
BingbotMicrosoftCrawler für BingGrundlage für Bing und Copilot
OAI-SearchBotOpenAISuchfunktion in ChatGPTNennung als Quelle in ChatGPT-Antworten
GPTBotOpenAITrainingsdaten für SprachmodelleKeine direkte Sichtbarkeit
ClaudeBotAnthropicTrainingsdaten für SprachmodelleKeine direkte Sichtbarkeit

Google crawlt seit der Umstellung auf Mobile First fast nur noch mit dem Smartphone-Agenten. Für SEO heißt das: Ihre mobile Version ist die maßgebliche Version. Eine aktuelle Liste aller Google-Crawler pflegt Google in der Search Central. Dort finden Sie auch das Token Google-Extended. Es steuert, ob Google Ihre Inhalte für das Training von Gemini nutzen darf.

5. Crawlbarkeit und Indexierbarkeit: der Unterschied

Crawlbarkeit, auf Englisch Crawlability, beschreibt, ob ein Bot eine Seite erreichen und lesen kann. Indexierbarkeit beschreibt, ob die Suchmaschine die Seite in ihren Index aufnehmen darf. Beides hängt zusammen, ist aber nicht dasselbe. Eine Seite kann crawlbar sein und trotzdem per noindex aus dem Index ausgeschlossen werden.

Gute Crawlability entsteht durch mehrere Faktoren, die Suchmaschinen gemeinsam bewerten. Eine klare Seitenstruktur mit flacher Hierarchie hilft dem Crawler, wichtige Seiten schnell zu finden. Eine durchdachte interne Verlinkung zeigt ihm, welche Inhalte zusammengehören. Schnelle Ladezeiten und ein stabiler Server sorgen dafür, dass er mehr Seiten pro Besuch schafft. Wichtige Inhalte sollten außerdem direkt im HTML stehen und nicht erst per JavaScript erscheinen.

Ein Praxisbeispiel: Ein Maschinenbauer stellt technische Datenblätter nur über ein Suchformular bereit. Kein Link führt direkt zu den einzelnen Seiten. Für Besucher funktioniert das. Für Crawler bleiben diese Unterseiten unsichtbar, weil Bots keine Formulare ausfüllen. Eine Übersichtsseite mit echten Links löst das Problem in wenigen Tagen.

6. Crawler steuern: robots.txt, noindex und Sitemaps

Sie haben drei zentrale Werkzeuge, um Crawler zu lenken. Die robots.txt ist eine Textdatei im Stammverzeichnis Ihrer Domain. Sie enthält Regeln, welche Bereiche ein Bot abrufen darf. Die Anweisungen gelten pro User-Agent. Ein einfaches Beispiel sieht so aus:

User-agent: *
Disallow: /intern/
Disallow: /*?filter=

User-agent: GPTBot
Disallow: /

Sitemap: https://www.ihre-domain.de/sitemap.xml

Wichtig ist eine Einschränkung, die Google selbst betont. Die robots.txt verhindert das Crawling, aber nicht zuverlässig die Indexierung. Ist eine gesperrte URL extern verlinkt, kann sie trotzdem im Index auftauchen. Um eine Seite sicher aus den Suchergebnissen zu halten, nutzen Sie das Meta-Robots-Tag noindex. Der Crawler muss die Seite dafür allerdings abrufen dürfen. Sonst sieht er die Anweisung nie.

Das dritte Werkzeug sind XML-Sitemaps. Sie listen alle wichtigen URLs auf und zeigen, wann sich Inhalte geändert haben. Reichen Sie Ihre Sitemap in der Google Search Console und den Bing Webmaster Tools ein. Verweisen Sie zusätzlich in der robots.txt darauf. Eine Sitemap ersetzt aber keine gute interne Verlinkung.

7. Typische Crawling-Probleme und Fehler

In unseren SEO-Audits begegnen uns immer wieder dieselben Probleme. Die meisten sind schnell behoben, wenn man sie erst einmal kennt. Gefährlich sind Probleme, die niemand bemerkt.

Serverfehler und falsche Statuscodes

Liefert Ihr Server auf viele Anfragen Statuscodes der 500er-Reihe, drosselt Google das Crawling. Solche Serverfehler entstehen oft durch überlastetes Hosting oder fehlerhafte Plugins. Auch Fehlerseiten mit Code 404 sind ein Thema. Einzelne 404-Seiten sind normal. Viele interne Links auf nicht existierende Seiten verschwenden jedoch Crawling-Zeit und frustrieren Besucher.

Weiterleitungen und Weiterleitungsketten

Nach einem Relaunch entstehen oft Weiterleitungsketten. Seite A leitet auf B, B auf C und C auf D. Jede Stufe kostet Zeit und schwächt Signale. Google folgt laut eigener Dokumentation maximal zehn Weiterleitungen in Folge. Leiten Sie alte Adressen deshalb immer direkt auf das finale Ziel weiter.

JavaScript und Rendern

Viele moderne Websites laden Inhalte erst per JavaScript. Der Googlebot kann diese Skripte rendern, braucht dafür aber zusätzliche Ressourcen. Links, die nur über JavaScript-Events funktionieren, erkennt er oft gar nicht. Crawler folgen zuverlässig nur echten Links mit href-Attribut. Für KI-Crawler ist die Lage noch kritischer, wie Abschnitt 9 zeigt.

Ungewollte Blockierungen

Ein Klassiker aus der Praxis: Die Testumgebung blockiert alle Bots mit „Disallow: /“. Beim Livegang übernimmt die Agentur diese Datei unbemerkt. Wochen später bricht die Sichtbarkeit ein. Ähnlich schädlich sind gesperrte CSS- oder JavaScript-Dateien. Dann kann Google die Seite nicht korrekt rendern.

Langsame Ladezeiten und schwache Performance

Antwortet Ihr Server langsam, ruft der Crawler weniger Seiten ab. Gute Performance hilft also nicht nur Ihren Besuchern. Sie sorgt auch dafür, dass Änderungen an Ihren Inhalten schneller im Index ankommen.

8. Crawlability prüfen: Tools, Audits und Serverprotokolle

Die wichtigste kostenlose Quelle ist die Google Search Console. Ihre Berichte sind für jede SEO-Analyse Pflicht. Der Bericht zur Seitenindexierung zeigt, welche URLs indexiert sind und warum andere fehlen. Die Crawling-Statistiken in den Einstellungen verraten, wie oft der Googlebot Ihre Website besucht. Mit der URL-Prüfung sehen Sie, wie Google eine einzelne Seite rendert.

Für tiefere Analysen nutzen wir Crawling-Tools wie den Screaming Frog SEO Spider. Das Desktop-Programm crawlt Ihre Website so, wie es ein Webcrawler der Suchmaschinen tut. In der kostenlosen Version prüft es bis zu 500 URLs. Sie erkennen damit defekte Links, Weiterleitungsketten, fehlende Meta-Angaben und verwaiste Seiten. Cloudbasierte Audits von Anbietern wie SE Ranking oder Sistrix ergänzen diese Prüfung.

Den ehrlichsten Blick liefern Ihre Serverprotokolle. Diese Logfiles zeigen jede Anfrage an Ihren Server. Sie sehen dort, welche Bots wirklich kommen, welche Seiten sie abrufen und wo Fehler auftreten. Gerade für KI-Crawler ist die Logfile-Analyse oft die einzige verlässliche Datenquelle. Kein Anbieter liefert Ihnen dazu ein bequemes Dashboard.

9. KI-Crawler: zulassen oder blockieren?

Mit generativer KI hat sich der Datenhunger im Web verändert. Laut einer Analyse von Cloudflare diente 2025 rund 80 Prozent des KI-Crawlings dem Training von Modellen. Nur 18 Prozent entfielen auf Suchfunktionen und 2 Prozent auf direkte Nutzeraktionen. Cloudflare hat außerdem gemessen, wie viele Seiten ein Anbieter pro zurückgeschicktem Besucher abruft. Im Juni 2025 lag dieser Wert bei Google bei etwa 14 zu 1. Bei OpenAI waren es rund 1.700 zu 1 und bei Anthropic rund 73.000 zu 1.

Hinzu kommt ein technischer Punkt. Eine Untersuchung von Vercel und MERJ zeigte, dass keiner der großen KI-Crawler JavaScript ausführt. GPTBot und ClaudeBot sehen nur den reinen HTML-Quellcode. Inhalte, die erst im Browser entstehen, existieren für diese LLMs schlicht nicht. Wer in KI-Antworten auftauchen will, braucht serverseitig ausgelieferte Inhalte. Das gilt für KI-Suchmaschinen genauso wie für klassische SEO.

Unsere Empfehlung lautet daher: Unterscheiden Sie nach Zweck. Such-Crawler wie OAI-SearchBot sollten Sie zulassen, wenn Sie in ChatGPT als Quelle erscheinen möchten. Reine Trainings-Crawler wie GPTBot oder ClaudeBot können Sie blockieren, ohne direkte Sichtbarkeit zu verlieren. Die richtige Entscheidung hängt von Ihrem Geschäftsmodell ab. Ein Fachverlag entscheidet anders als ein Maschinenbauer, der vor allem bekannt werden will. Mehr zur Sichtbarkeit in KI-Antworten lesen Sie in unserem Beitrag zu Google AI Overviews.

Unbequeme Anmerkung

Google koppelt seine Suche eng an seine KI. Mit Google-Extended sperren Sie nur das Gemini-Training. Für AI Overviews nutzt Google weiterhin den normalen Googlebot. Wer dort nicht verwertet werden will, müsste sich faktisch aus der Google-Suche verabschieden. Für die meisten Unternehmen ist das keine echte Wahl. Genau diese Abhängigkeit von wenigen US-Konzernen sollten Sie intern offen ansprechen.

Seien Sie auch skeptisch bei schnellen Versprechen. Eine llms.txt-Datei oder gekaufte Backlinks machen Sie nicht über Nacht zur Quelle von ChatGPT. Kein großer Anbieter hat bisher bestätigt, dass er llms.txt auswertet. Nachhaltige Sichtbarkeit entsteht durch crawlbare Technik und Inhalte mit echtem Mehrwert.

10. Ohne Crawler keine Sichtbarkeit

Crawler sind die Türsteher zwischen Ihrer Website und Ihren Kunden. Sie entscheiden, welche Inhalte Suchmaschinen und KI-Systeme überhaupt kennen. Ohne Zugang kein Ranking, ganz gleich wie gut Ihr Content ist. Gute Crawlbarkeit ist deshalb kein Nischenthema für Entwickler. Sie ist die Grundlage jeder SEO-Strategie. Prüfen Sie Ihre robots.txt, Ihre Statuscodes und Ihre interne Linkstruktur mindestens einmal pro Quartal.

Gleichzeitig verdient das Thema einen kritischen Blick. Nicht jeder Bot meint es gut mit Ihnen. Manche KI-Anbieter nehmen weit mehr Daten, als sie an Besuchern zurückgeben. Legen Sie deshalb bewusst fest, wen Sie einlassen. Diese Entscheidung sollte nicht ein Plugin für Sie treffen.

Sie möchten wissen, wie Google und KI-Crawler Ihre Website sehen? Wir analysieren Crawlability, Indexierung und Serverprotokolle und besprechen die Ergebnisse mit Ihnen auf Augenhöhe. Vereinbaren Sie jetzt ein unverbindliches Gespräch mit unserem SEO-Team in Karlsruhe.

Wie sehen Crawler Ihre Website?

Paseo Marketing prüft die Crawlbarkeit Ihrer Website für Google, Bing und KI-Suchmaschinen. Wir zeigen Ihnen ehrlich, wo es hakt, und setzen die Lösung gemeinsam mit Ihnen um.

FAQ zum Thema Crawler

Was ist ein Crawler einfach erklärt?

Ein Crawler ist ein Programm, das Webseiten automatisch besucht und ihre Inhalte ausliest. Er folgt Links von Seite zu Seite. Suchmaschinen wie Google nutzen Crawler, um ihren Index aufzubauen.

Was ist der Unterschied zwischen Crawling und Indexierung?

Beim Crawling ruft ein Bot eine Seite ab und liest sie. Bei der Indexierung speichert die Suchmaschine die Seite in ihrem Index. Nicht jede gecrawlte Seite wird auch indexiert.

Wie oft crawlt Google meine Website?

Das hängt von Größe, Aktualität und Serverleistung Ihrer Website ab. Häufig aktualisierte Seiten besucht der Googlebot öfter. Die genauen Werte sehen Sie in den Crawling-Statistiken der Google Search Console.

Sollte ich KI-Crawler wie GPTBot blockieren?

Das hängt von Ihrem Ziel ab. GPTBot sammelt Trainingsdaten und bringt kaum Besucher. OAI-SearchBot sorgt dagegen dafür, dass ChatGPT Sie als Quelle nennen kann. Viele Unternehmen blockieren deshalb nur die Trainings-Crawler.

Wie prüfe ich, ob meine Website crawlbar ist?

Starten Sie mit dem Indexierungsbericht und der URL-Prüfung in der Google Search Console. Ein Crawling-Tool wie Screaming Frog findet defekte Links und Weiterleitungsketten. Serverprotokolle zeigen, welche Bots tatsächlich kommen.

SEO GEO Checkliste 2026
Gratis Web Analyse
Ki Suche Tracking kostenloses Dashboard
BFSG Checkliste
Lokales SEO für KMU?
Glaskugel als Symbol für Zukunft

Webanalyse

Jetzt kostenlose Webanalyse anfordern

Kontaktformular

Wir freuen uns auf Ihre Nachricht