Regeln
Deutsches SEO-Umfeld: robots.txt-Fehler und ihre Folgen
Die robots.txt-Datei liegt im Stammverzeichnis einer Website (z.B. https://example.com/robots.txt) und teilt konformen Crawlern mit, welche URLs sie aufrufen duerfen. Es ist eine Konvention, kein Sicherheitsmechanismus, jeder Bot kann sie ignorieren.
Im DACH-Raum ist Bing Webmaster Tools neben Google Search Console relevant: Bing hat in Deutschland einen Marktanteil von rund 10 % und verarbeitet robots.txt-Regeln aehnlich, jedoch nicht identisch. Hetzner (AS24940), IONOS und Strato gehoeren zu den verbreitetsten Hosting-Anbietern in DE, deren Linux-Server sind gross-/kleinschreibungsempfindlich. Disallow: /Admin/ blockiert nicht /admin/.
Ein typischer Fehler bei TYPO3-Projekten (sehr verbreitet in Deutschland) und Contao: CSS- und JS-Dateien versehentlich sperren, weil der Entwickler unerwuenschte Parameterpfade blockieren wollte. Google kann die Seite dann nicht rendern und bewertet sie schlechter. Fuer mehrsprachige Webseiten mit hreflang muss Googlebot alle Sprachversionen erreichen koennen.
Tabelle gaengiger Direktiven
| Direktive | Wirkung | SEO-Hinweis |
|---|---|---|
Disallow: / | Gesamte Website gesperrt | Katastrophal bei User-agent: * |
Disallow: /typo3/ | Backend-Verzeichnis sperren | Korrekt, kein Indexierungsbedarf |
Disallow: /*.css$ | CSS-Dateien sperren | Unterbricht Google-Rendering |
Disallow: /*?* | Parameter-URLs sperren | Crawl-Budget schonen |
Sitemap: | Sitemap-URL angeben | Beschleunigt Entdeckung |
Was robots.txt nicht kann
Eine in robots.txt gesperrte URL verschwindet nicht aus dem Google-Index. Bereits indexierte Seiten oder Seiten mit externen Backlinks koennen weiter in den Ergebnissen erscheinen. Fuer echte Entfernung: <meta name="robots" content="noindex"> verwenden (Googlebot muss die Seite crawlen koennen) oder das URL-Entfernungstool in der Google Search Console. Ein 5xx-Fehler auf /robots.txt kann dazu fuehren, dass Google die gesamte Domain als blockiert behandelt.
Workflow: generieren, testen, deployen
Nach der Erstellung der Regeln jede Ziel-URL mit dem robots.txt-Tester pruefen, bevor das File ins Stammverzeichnis des Servers hochgeladen wird. Anschliessend die robots.txt in der Google Search Console einreichen, um die Lesbarkeit zu bestaetigen. Bei Bing: Bing Webmaster Tools > Crawl-Einstellungen separat kontrollieren.