robots.txt online generieren | Regeln, Crawler | Awesome Toolkit

robots.txt Generator

robots.txt mit Crawl-Regeln, Crawl-Delay, Sitemap und User-Agent-Direktiven generieren. Direkter Download.

Von Marshkalk

Regeln

Deutsches SEO-Umfeld: robots.txt-Fehler und ihre Folgen

Die robots.txt-Datei liegt im Stammverzeichnis einer Website (z.B. https://example.com/robots.txt) und teilt konformen Crawlern mit, welche URLs sie aufrufen duerfen. Es ist eine Konvention, kein Sicherheitsmechanismus, jeder Bot kann sie ignorieren.

Im DACH-Raum ist Bing Webmaster Tools neben Google Search Console relevant: Bing hat in Deutschland einen Marktanteil von rund 10 % und verarbeitet robots.txt-Regeln aehnlich, jedoch nicht identisch. Hetzner (AS24940), IONOS und Strato gehoeren zu den verbreitetsten Hosting-Anbietern in DE, deren Linux-Server sind gross-/kleinschreibungsempfindlich. Disallow: /Admin/ blockiert nicht /admin/.

Ein typischer Fehler bei TYPO3-Projekten (sehr verbreitet in Deutschland) und Contao: CSS- und JS-Dateien versehentlich sperren, weil der Entwickler unerwuenschte Parameterpfade blockieren wollte. Google kann die Seite dann nicht rendern und bewertet sie schlechter. Fuer mehrsprachige Webseiten mit hreflang muss Googlebot alle Sprachversionen erreichen koennen.

Tabelle gaengiger Direktiven

DirektiveWirkungSEO-Hinweis
Disallow: /Gesamte Website gesperrtKatastrophal bei User-agent: *
Disallow: /typo3/Backend-Verzeichnis sperrenKorrekt, kein Indexierungsbedarf
Disallow: /*.css$CSS-Dateien sperrenUnterbricht Google-Rendering
Disallow: /*?*Parameter-URLs sperrenCrawl-Budget schonen
Sitemap:Sitemap-URL angebenBeschleunigt Entdeckung

Was robots.txt nicht kann

Eine in robots.txt gesperrte URL verschwindet nicht aus dem Google-Index. Bereits indexierte Seiten oder Seiten mit externen Backlinks koennen weiter in den Ergebnissen erscheinen. Fuer echte Entfernung: <meta name="robots" content="noindex"> verwenden (Googlebot muss die Seite crawlen koennen) oder das URL-Entfernungstool in der Google Search Console. Ein 5xx-Fehler auf /robots.txt kann dazu fuehren, dass Google die gesamte Domain als blockiert behandelt.

Workflow: generieren, testen, deployen

Nach der Erstellung der Regeln jede Ziel-URL mit dem robots.txt-Tester pruefen, bevor das File ins Stammverzeichnis des Servers hochgeladen wird. Anschliessend die robots.txt in der Google Search Console einreichen, um die Lesbarkeit zu bestaetigen. Bei Bing: Bing Webmaster Tools > Crawl-Einstellungen separat kontrollieren.