Cas d'usage FR : tester avant toute mise en production
Cet outil verifie si un chemin URL est autorise ou bloque par un contenu robots.txt donne, pour un user-agent specifique. Collez le robots.txt d'un site live, d'un environnement de staging ou genere par l'outil, puis saisissez le chemin a tester.
Erreur classique dans les agences web francaises : un developpeur oublie de retirer le Disallow: / ajoute pour proteger la recette avant la mise en ligne. Le fichier se retrouve en production et Googlebot est bloque pendant plusieurs semaines avant que le client ne remarque la chute de trafic. Ce test prend dix secondes et evite des semaines de perte de positionnement.
Le testeur officiel de Google se trouve dans Google Search Console (outils legacy) mais exige un acces verifie a la propriete. Cet outil fonctionne sans connexion, avec n'importe quel contenu robots.txt.
Difference robots.txt vs balise noindex
| Mecanisme | Ce qu'il controle | Page encore dans l'index ? |
|---|---|---|
| Disallow (robots.txt) | Empeche Googlebot de visiter l'URL | Oui, si des sites externes pointent dessus |
| meta noindex | Googlebot visite mais n'indexe pas | Non, retire apres le prochain crawl |
| Les deux combines | Googlebot ne peut pas lire le noindex | Oui, le Disallow bloque la lecture du noindex |
Bloquer une URL avec Disallow ET l'annoter noindex est contre-productif : Googlebot ne peut pas lire la balise s'il est empeche d'acceder a la page. Retirez le Disallow et laissez noindex seul gerer la desindexation.
Correspondance des regles et cas particuliers
La plupart des crawlers appliquent la regle du chemin le plus specifique : l'entree la plus longue correspondante l'emporte. Pour Googlebot, un Allow: /admin/public/ prime sur un Disallow: /admin/ plus large. Les jokers (* dans les chemins, $ en fin d'URL) sont supportes par Google et Bing. Verifiez aussi que le chemin du sitemap n'est pas accidentellement bloque, un sitemap inaccessible ralentit considerablement la decouverte des URLs.
Workflow
Apres avoir teste ici, generez ou editez le robots.txt complet avec le generateur robots.txt, puis verifiez l'entete HTTP de /robots.txt avec le verificateur de redirections pour confirmer que le fichier repond en 200, pas via une chaine de redirections.