robots.txt-Prüfer
robots.txt prüfen: Datei laden, Regeln verstehen und testen, ob Googlebot einen Pfad crawlen darf – kostenlos ohne Anmeldung.
Der robots.txt-Prüfer lädt die robots.txt einer Domain, zeigt User-Agent-Gruppen, Allow-/Disallow-Regeln und Sitemap-Einträge und testet, ob ein Pfad für Googlebot erlaubt ist. Du kannst auch eine Datei erzeugen und kopieren. Die Sitemap selbst wird nicht gecrawlt. Kostenlos und ohne Anmeldung.
Was ist eine robots.txt?
robots.txt ist eine Textdatei im Wurzelverzeichnis einer Website. Crawler lesen sie, bevor sie
weitere URLs anfordern. Mit User-agent und Disallow steuerst du, was
nicht geholt werden soll – zum Beispiel Admin-Bereiche, interne Suche oder doppelte
Filter-URLs. Die Datei ersetzt kein Passwort und kein noindex.
Typische Regeln
| Regel | Wirkung |
|---|---|
User-agent: *Disallow: | Alle Crawler, nichts gesperrt. |
Disallow: /wp-admin/ | Admin-Ordner nicht crawlen (Inhalte können trotzdem indexiert werden). |
Allow: /wp-admin/admin-ajax.php | Ausnahme innerhalb eines gesperrten Pfads – längere Regel gewinnt. |
Sitemap: https://…/sitemap.xml | Hinweis auf die XML-Sitemap, unabhängig von den Gruppen. |
So gehst du vor
- Domain prüfen oder den Dateiinhalt einfügen.
- Mit dem Pfad-Tester nachschauen, ob z. B.
/warenkorbfür Googlebot offen ist. - Eine neue Datei unter „Erstellen“ kopieren und auf den Server legen. Ob geteilte Links danach richtig aussehen, prüfst du mit dem Metadaten-Checker; Kampagnen-URLs baust du mit dem UTM-Link-Builder.
Beispiel
Ein Shop sperrt /warenkorb und /konto, nennt aber die
Produkt-Sitemap. Googlebot soll Kategorieseiten weiter holen dürfen. Der Pfad-Tester zeigt
dann „Gesperrt“ für /warenkorb?id=1 (Präfix /warenkorb) und „Erlaubt“ für /produkte/schuhe.
Häufige Fragen
Was macht eine robots.txt?
Die Datei liegt unter https://deine-domain.de/robots.txt und sagt Crawlern, welche Pfade sie nicht abrufen sollen. Sie ist keine Zugangskontrolle: gesperrte URLs können trotzdem indexiert werden, wenn andere Seiten darauf verlinken. Für „nicht in Google“ brauchst du noindex.
Warum wird /robots.txt und nicht meine Unterseite geladen?
Der Standard erlaubt nur eine robots.txt an der Domain-Wurzel. Eine Datei unter /blog/robots.txt ignorieren Crawler. Deshalb ruft das Tool immer https://host/robots.txt ab.
Was bedeutet Status 404?
Es gibt keine robots.txt. Für Google ist dann alles crawlbar. Das ist kein Fehler – viele kleine Sites brauchen keine Datei. Erst wenn du Bereiche sperren oder eine Sitemap nennen willst, lohnt sich eine.
Prüft das Tool die URLs in der Sitemap?
Nein. Angezeigt werden nur die Sitemap:-Zeilen. Ein voller Crawl wäre langsam und als offener Proxy missbrauchbar. Ob eine URL in der Sitemap erreichbar ist, prüfst du in der Search Console.
Wie entscheidet Google bei Allow und Disallow?
Es gilt die längste passende Regel. Sind Allow und Disallow gleich lang, gewinnt Allow. Ohne passende Regel ist der Pfad erlaubt. * steht für beliebige Zeichen, $ für das Ende des Pfads.
Ändert dieses Tool meine echte robots.txt?
Nein. Prüfen liest nur, Erstellen erzeugt Text zum Kopieren. Die Datei musst du selbst ins Wurzelverzeichnis deiner Website legen.