Testar robots.txt | URL bloqueada ou não? | Awesome Toolkit

Testador robots.txt

Teste se uma URL está bloqueada pelo seu robots.txt para um user-agent dado. Cole o robots.txt e a URL.

Por Marshkalk

Casos de uso BR/PT: testar antes do deploy em producao

Esta ferramenta verifica se um caminho URL e permitido ou bloqueado por um conteudo robots.txt dado, para um user-agent especifico. Cole o robots.txt de um site live, de um ambiente de staging ou gerado pela ferramenta, e introduza o caminho a verificar.

Erro comum em agencias brasileiras: o robots.txt do ambiente de homologacao (Disallow: /) e copiado para producao durante um deploy. O Googlebot fica bloqueado ate o cliente notar a queda de trafego. Este teste leva dez segundos e evita semanas de perda de posicionamento.

O testador oficial do Google esta no Google Search Console (ferramentas legacy), mas exige acesso verificado a propriedade. Esta ferramenta funciona sem ligacao, com qualquer conteudo robots.txt, e permite tambem verificar os sitemaps.

Diferenca: robots.txt vs meta noindex

MecanismoO que controlaPagina ainda no indice?
Disallow (robots.txt)Impede o Googlebot de visitar o URLSim, se sites externos apontarem para ela
meta noindexGooglebot visita mas nao indexaNao, removida apos o proximo rastreio
Ambos combinadosGooglebot nao consegue ler o noindexSim, Disallow impede a leitura do noindex

Bloquear um URL com Disallow e tambem anota-lo com noindex e contraproducente: o Googlebot nao consegue ler a tag se o acesso estiver bloqueado. Remova o Disallow e use apenas noindex para desindexar a pagina.

Correspondencia de regras e casos especiais

A maioria dos crawlers aplica a regra do caminho mais especifico: a entrada mais longa correspondente ganha. Para o Googlebot, um Allow: /admin/public/ anula um Disallow: /admin/ mais amplo. Caracteres especiais (* em caminhos, $ no final do URL) sao suportados pelo Google e pelo Bing. Verifique tambem que o caminho do sitemap nao esta bloqueado acidentalmente.

Fluxo de trabalho

Apos testar aqui, gere ou edite o robots.txt completo com o gerador robots.txt. Em seguida, verifique o cabecalho HTTP de /robots.txt com o verificador de redirecionamentos para confirmar que o ficheiro responde com estado 200, nao atraves de uma cadeia de redirecionamentos.