Generar robots.txt online | Reglas, Crawlers | Awesome Toolkit

Generador robots.txt

Genera un archivo robots.txt con tus reglas de crawl, crawl-delay, sitemap y directivas por user-agent.

Por Marshkalk

Reglas

SEO en Espana y LATAM: errores robots.txt que penaliza Google

El archivo robots.txt se coloca en la raiz de un sitio web (ej. https://example.com/robots.txt) e indica a los crawlers conformes que URLs pueden o no pueden visitar. Es una convencion, no un mecanismo de seguridad: cualquier bot puede ignorarla.

En Espana, Bing mantiene una cuota de mercado relevante (alrededor del 8-10 %), por lo que conviene comprobar las reglas tambien en Bing Webmaster Tools. Los hostings espanoles como Raiola Networks o SiteGround ES usan servidores Linux: los paths son sensibles a mayusculas. Disallow: /Tienda/ no bloquea /tienda/.

Para tiendas PrestaShop o Magento en Espana y LATAM, el presupuesto de rastreo es clave: bloquear URLs con parametros (?id_currency=, ?page=) evita que Google gaste creditos en paginas sin valor SEO. En sitios con versiones ES/CA (catalan) o ES/EN, el robots.txt debe permitir el acceso a todos los prefijos de idioma para que hreflang funcione correctamente.

Tabla de directivas comunes

DirectivaEfectoNota SEO
Disallow: /Bloquea todo el sitioCatastrofico si se aplica a User-agent: *
Disallow: /admin/Bloquea el panel de administracionCorrecto, sin necesidad de indexacion
Disallow: /*.css$Bloquea archivos CSSRompe el renderizado de Google
Disallow: /*?*Bloquea URLs con parametrosAhorra presupuesto de rastreo
Sitemap:Declara la URL del sitemapAcelera el descubrimiento

Lo que robots.txt no puede hacer

Bloquear una URL en robots.txt no la elimina del indice de Google. Las paginas ya indexadas o enlazadas desde sitios externos pueden seguir apareciendo. Para eliminarlas realmente, usa la etiqueta <meta name="robots" content="noindex"> (Google debe poder rastrear la pagina para leerla) o la herramienta de eliminacion de URLs en Google Search Console ES. Un error 5xx en /robots.txt puede llevar a Google a tratar el dominio completo como bloqueado.

Flujo de trabajo: generar, probar, desplegar

Tras generar las reglas, verifica cada URL con el probador de robots.txt antes de subir el archivo a la raiz del servidor. Despues, envia el robots.txt en Google Search Console para confirmar que Googlebot puede leerlo. En cambios de dominio (.es a .com), revisa que las reglas del nuevo dominio no repliquen bloqueos heredados del anterior.