Eine Zeile in der robots.txt entscheidet, ob Google Ihre Seite sieht – und ob ChatGPT sie zitieren darf. Der Tester lädt die Datei live, wertet sie nach denselben Regeln aus wie Google und zeigt für 16 Crawler auf einen Blick, wer Ihre Website lesen darf. Dazu die Syntax-Prüfung und der Hinweis, welche Regel im Zweifel gewinnt.
robots.txt-Tester
Prüft live, ob eine URL für Googlebot, Bingbot oder KI-Crawler wie GPTBot und ClaudeBot freigegeben ist – nach den offiziellen Regeln (längster Pfad gewinnt, Allow vor Disallow bei Gleichstand, Wildcards und $ werden ausgewertet). Dazu die Übersicht, welche Bots die Website insgesamt blockiert.
So funktioniert der Test
Geben Sie eine beliebige URL Ihrer Website ein – nicht nur die Startseite. Der Tester holt die robots.txt der Domain, wählt die Gruppe, die zum gewählten Crawler passt, und prüft den Pfad gegen alle Allow- und Disallow-Regeln. Das Ergebnis nennt die entscheidende Regel mit Zeilennummer, damit Sie sie direkt in der Datei finden.
Die Tabelle darunter zeigt für Suchmaschinen und KI-Systeme, ob Startseite und geprüfte URL erlaubt sind. Das ist die schnellste Antwort auf die Frage, die derzeit fast jede Website betrifft: Sind wir für ChatGPT Search, Perplexity und Claude überhaupt erreichbar?
Die Regeln, nach denen Google entscheidet
- Längster Pfad gewinnt. Bei Disallow: /blog/ und Allow: /blog/seo-tipps/ ist die SEO-Tipps-Seite erlaubt, alles andere im Blog gesperrt.
- Allow schlägt Disallow bei gleicher Länge. Wer beides für denselben Pfad hat, hat die Seite freigegeben.
- Wildcards und Dollarzeichen zählen. Disallow: /*.pdf$ sperrt alle PDFs, Disallow: /*? alle URLs mit Parametern.
- Die spezifischste User-agent-Gruppe zählt, nicht alle zusammen. Hat GPTBot eine eigene Gruppe, ignoriert er die Regeln unter User-agent: * komplett.
- Crawl-delay, Host und Noindex versteht Google nicht. Sie schaden nicht, bewirken aber auch nichts.
Der häufigste Fehler
Eine eigene Gruppe für einen Crawler anlegen und dort nur eine Zeile eintragen. Beispiel: User-agent: GPTBot mit Disallow: /intern/. Damit gilt für GPTBot ausschließlich diese Regel – alle Sperren aus der Sternchen-Gruppe sind für ihn aufgehoben. Wer Regeln vererben will, muss sie in jeder Gruppe wiederholen.
KI-Crawler: Wer ist wer?
Die Namen sind verwirrend, weil ein Anbieter mehrere Bots betreibt. GPTBot sammelt Trainingsdaten für OpenAI, OAI-SearchBot baut den Index für ChatGPT Search, ChatGPT-User ruft Seiten ab, wenn ein Nutzer im Chat danach fragt. Bei Google trennt Google-Extended das Gemini-Training vom normalen Googlebot, der weiterhin die Suche und die KI-Übersichten speist. ClaudeBot und PerplexityBot stehen für Anthropic und Perplexity.
Wer in KI-Antworten sichtbar sein will, lässt die Antwort-Crawler zu und sperrt höchstens die reinen Trainings-Bots. Wer alle sperrt, ist in ChatGPT und Perplexity unsichtbar – und das merken Sie in keinem Ranking-Tool. Der Tester zeigt Ihnen die Sperren, bevor es ein Kunde tut.
Häufige Fragen
Was passiert, wenn es keine robots.txt gibt?
Dann dürfen alle Crawler alles. Ein 404 unter /robots.txt ist ausdrücklich erlaubt und kein Fehler. Kritisch ist dagegen ein Serverfehler (5xx): Google behandelt die Website dann vorübergehend so, als wäre sie komplett gesperrt.
Verhindert Disallow die Indexierung?
Nein. Disallow verbietet nur das Crawlen. Wird eine gesperrte URL von anderen Seiten verlinkt, kann sie trotzdem im Index landen – dann ohne Inhalt. Wer eine Seite aus dem Index halten will, braucht ein noindex-Tag, und dafür muss die Seite crawlbar sein.
Welche Regel gewinnt bei Widersprüchen?
Die spezifischere, also die mit dem längsten Pfad. Bei gleicher Länge gewinnt Allow. Wildcards (*) und das Dollarzeichen für das Pfadende werden dabei ausgewertet – genau so rechnet auch dieser Tester.
Sollte ich KI-Crawler wie GPTBot sperren?
Das hängt vom Ziel ab. Wer in ChatGPT, Perplexity und Co. als Quelle genannt werden will, muss OAI-SearchBot, ChatGPT-User, ClaudeBot und PerplexityBot zulassen. Wer nur das Training von Modellen mit eigenen Inhalten verhindern will, sperrt gezielt GPTBot, Google-Extended und CCBot – die Antwort-Crawler bleiben offen.
Fazit
Prüfen Sie Ihre robots.txt nach jedem Relaunch und jeder Plugin-Änderung – eine vergessene Staging-Sperre ist der Klassiker unter den Sichtbarkeitsverlusten. Und entscheiden Sie bewusst, ob KI-Crawler rein dürfen, statt es einem Standard-Snippet zu überlassen.
Sie wollen wissen, ob Ihre Website in ChatGPT, Perplexity und Google AI Mode tatsächlich auftaucht? Ich prüfe es mit echten Prompts.GEO-Check anfragen







