robots.txt-Prüfer

robots.txt prüfen: Datei laden, Regeln verstehen und testen, ob Googlebot einen Pfad crawlen darf – kostenlos ohne Anmeldung.

Der robots.txt-Prüfer lädt die robots.txt einer Domain, zeigt User-Agent-Gruppen, Allow-/Disallow-Regeln und Sitemap-Einträge und testet, ob ein Pfad für Googlebot erlaubt ist. Du kannst auch eine Datei erzeugen und kopieren. Die Sitemap selbst wird nicht gecrawlt. Kostenlos und ohne Anmeldung.

Beispiel gefällig? ·

Was ist eine robots.txt?

robots.txt ist eine Textdatei im Wurzelverzeichnis einer Website. Crawler lesen sie, bevor sie weitere URLs anfordern. Mit User-agent und Disallow steuerst du, was nicht geholt werden soll – zum Beispiel Admin-Bereiche, interne Suche oder doppelte Filter-URLs. Die Datei ersetzt kein Passwort und kein noindex.

Typische Regeln

RegelWirkung
User-agent: *
Disallow:
Alle Crawler, nichts gesperrt.
Disallow: /wp-admin/Admin-Ordner nicht crawlen (Inhalte können trotzdem indexiert werden).
Allow: /wp-admin/admin-ajax.phpAusnahme innerhalb eines gesperrten Pfads – längere Regel gewinnt.
Sitemap: https://…/sitemap.xmlHinweis auf die XML-Sitemap, unabhängig von den Gruppen.

So gehst du vor

  1. Domain prüfen oder den Dateiinhalt einfügen.
  2. Mit dem Pfad-Tester nachschauen, ob z. B. /warenkorb für Googlebot offen ist.
  3. Eine neue Datei unter „Erstellen“ kopieren und auf den Server legen. Ob geteilte Links danach richtig aussehen, prüfst du mit dem Metadaten-Checker; Kampagnen-URLs baust du mit dem UTM-Link-Builder.

Beispiel

Ein Shop sperrt /warenkorb und /konto, nennt aber die Produkt-Sitemap. Googlebot soll Kategorieseiten weiter holen dürfen. Der Pfad-Tester zeigt dann „Gesperrt“ für /warenkorb?id=1 (Präfix /warenkorb) und „Erlaubt“ für /produkte/schuhe.

Häufige Fragen

Was macht eine robots.txt?

Die Datei liegt unter https://deine-domain.de/robots.txt und sagt Crawlern, welche Pfade sie nicht abrufen sollen. Sie ist keine Zugangskontrolle: gesperrte URLs können trotzdem indexiert werden, wenn andere Seiten darauf verlinken. Für „nicht in Google“ brauchst du noindex.

Warum wird /robots.txt und nicht meine Unterseite geladen?

Der Standard erlaubt nur eine robots.txt an der Domain-Wurzel. Eine Datei unter /blog/robots.txt ignorieren Crawler. Deshalb ruft das Tool immer https://host/robots.txt ab.

Was bedeutet Status 404?

Es gibt keine robots.txt. Für Google ist dann alles crawlbar. Das ist kein Fehler – viele kleine Sites brauchen keine Datei. Erst wenn du Bereiche sperren oder eine Sitemap nennen willst, lohnt sich eine.

Prüft das Tool die URLs in der Sitemap?

Nein. Angezeigt werden nur die Sitemap:-Zeilen. Ein voller Crawl wäre langsam und als offener Proxy missbrauchbar. Ob eine URL in der Sitemap erreichbar ist, prüfst du in der Search Console.

Wie entscheidet Google bei Allow und Disallow?

Es gilt die längste passende Regel. Sind Allow und Disallow gleich lang, gewinnt Allow. Ohne passende Regel ist der Pfad erlaubt. * steht für beliebige Zeichen, $ für das Ende des Pfads.

Ändert dieses Tool meine echte robots.txt?

Nein. Prüfen liest nur, Erstellen erzeugt Text zum Kopieren. Die Datei musst du selbst ins Wurzelverzeichnis deiner Website legen.