Robots.txt: cómo escribirlo sin cerrarle la puerta a Google
El robots.txt es un archivo de texto en la raíz del dominio que le dice a cada rastreador qué rutas puede visitar. Controla el rastreo, no la indexación: una URL bloqueada puede seguir saliendo en Google, sin descripción. Bien escrito, ahorra visitas inútiles y decide qué robots de IA leen el sitio web; una línea equivocada puede cerrarlo entero.
Para quien tenga que escribirlo o revisarlo: en una migración, con una tienda llena de filtros o ante los robots de IA.
Según cada empresa
Cuatro campos y rutas que empiezan por barra
Va en la raíz, en UTF-8 y hasta 500 KiB. Solo vale para el host, el protocolo y el puerto donde está: cada subdominio, el suyo.
User-agent: *
Disallow: /cart/
Disallow: /*?sort=
Allow: /cart/help
User-agent: GPTBot
Disallow: /
Sitemap: https://www.example.com/sitemap.xml
User-agent
Abre un grupo para un robot. El asterisco vale para todos, excepto los AdsBot de Google, que se han de nombrar.
Disallow
La ruta que no se puede rastrear. Empieza por / y distingue mayúsculas. Vacío, no hace nada.
Allow
Abre una ruta dentro de una cerrada.
Sitemap
La dirección completa del sitemap, con https://. No pertenece a ningún grupo.
El resto, Google lo ignora: Crawl-delay, noindex y cualquier línea mal escrita. Si quieres sacar una página de la búsqueda, el sitio es la propia página, con un noindex.
Qué regla manda cuando dos chocan
Elige un solo grupo
El del User-agent más específico para el robot; si no hay ninguno, el del asterisco. Dos grupos del mismo robot se juntan.
Busca las reglas que coinciden
Desde el principio de la ruta, con dos comodines: * para cualquier secuencia y $ para el final. /blog también cierra /blog-antic.
Manda la más larga
Gana la de ruta más larga, comodines incluidos. En empate, la menos restrictiva: el Allow.
Si no hay ninguna
La ruta se puede rastrear. Y si el archivo da un 404, Google entiende que puede rastrearlo todo.
/page con Allow: /p i Disallow: /Allow: se puede rastrearRuta más larga./folder/page con Allow: /folder i Disallow: /folderAllow: se puede rastrearEmpate: la menos restrictiva./page.htm con Allow: /page i Disallow: /*.htmDisallow: bloqueadaCon el comodín, es más larga.Ejemplos de la especificación de Google.
Las líneas que te pueden dejar fuera de Google
Disallow: / en la web publicada. Cierra todo el sitio y suele llegar con la copia del entorno de pruebas el día del lanzamiento.Nuestro criterio: con miles de URL de filtros o de búsqueda interna, es la herramienta buena para no gastar el rastreo. Y revísalo en cada migración o cambio de tema, con la versión de antes guardada.
Búsqueda o entrenamiento: bloquea solo lo que quieres
Cada empresa separa el robot de las respuestas del que recoge textos para entrenar modelos.
Nuestro criterio: si quieres salir en las respuestas, deja entrar a los robots de búsqueda; el entrenamiento es una decisión de negocio. Y no hace falta ningún archivo especial para la IA: para Google basta con que la página esté indexada.
El informe de robots.txt de Search Console
Enseña los robots.txt que Google ha encontrado en los 20 hosts principales del sitio. Solo sale en las propiedades de dominio o de prefijo sin ruta.
Mira el estado
Si Google ha podido leerlo, cuándo y qué tamaño tiene.
Lee los problemas
Los errores y avisos que Google ha encontrado.
Pide un nuevo rastreo
Google guarda una copia hasta 24 horas. Después de un cambio urgente, pide que vuelva a leerlo.
Comprueba la página
La inspección de URLs dice si una dirección está bloqueada. Para muchas rutas, la herramienta de aquí abajo o Screaming Frog.
Probador de robots.txt: quién puede entrar y por qué regla
Pega el archivo, elige el robot y escribe las rutas. Aplica las reglas de Google y, de paso, revisa la sintaxis. Para saber si una página lleva noindex, está el comprobador de la entrada Noindex.
/robots.txt.El resultado
Pega el robots.txt y como mínimo una ruta.
Este robot tiene cerrado todo el sitio: la regla que manda para la portada es un Disallow.
Puede rastrear todas las rutas que has puesto.
Hay rutas bloqueadas: comprueba que ninguna tenga que salir en la búsqueda.
Todas las rutas que has puesto están bloqueadas para este robot.
Puede entrarBloqueadaMandaPuede entrarBloqueadaMandaPuede entrarBloqueadaMandaPuede entrarBloqueadaMandaPuede entrarBloqueadaMandaPuede entrarBloqueadaManda
La revisión del archivo
- Ningún problema de sintaxis a la vista.
- Reglas antes de cualquier User-agent. Google no las aplica a nadie.
- Líneas que Google no reconoce:
. Revisa si están mal escritas. - Rutas que no empiezan por barra:
. - Bloqueas archivos CSS o JavaScript. Google los necesita para entender las páginas.
- Pasa de 500 KiB. Google ignora todo lo que hay después del límite.
- Hay un noindex. Google no lo admite en el robots.txt: ponlo en la página.
- Hay un Crawl-delay. Google lo ignora; ClaudeBot, por ejemplo, sí que lo respeta.
- Sitemap con dirección relativa. Tiene que ser la dirección completa, con https://.
- Sin línea Sitemap. No es obligatoria, pero es la manera de indicar dónde está.
- Google-Extended no te saca de la búsqueda. No es un robot aparte: solo limita el uso para Gemini.
- Solo se prueban las seis primeras rutas.
Ejemplo ilustrativo con la dirección de pruebas de Google, example.com. Se calcula en tu navegador: no se envía a ningún sitio. Otros robots pueden interpretar el archivo de otra manera.
Cuando el robots.txt ya no es una línea
- Search Console da páginas que aparecen como bloqueadas por el robots.txt.
- Has migrado el sitio o cambiado de tema y el tráfico orgánico ha bajado.
- La tienda genera miles de URL de filtros y Google se entretiene en ellas.
- No sabes qué robots de IA dejas entrar ni quién lo decidió.
Cuando hacemos una auditoría de SEO técnico a Daimatics, el robots.txt se revisa con los sitemaps, los noindex y los canonicals: tienen que decir lo mismo a Google.
Dudas sobre el robots.txt
Decide por dónde pasa el robot, no qué sale en Google.
¿Qué es el robots.txt y dónde se pone?
¿El robots.txt sirve para sacar una página de Google?
¿Cómo bloqueo ChatGPT en el robots.txt?
¿Bloquear Google-Extended me saca de Google?
¿Cuánto tarda Google en aplicar un cambio en el robots.txt?
Fuentes oficiales
Google Search Central
- Introducción al robots.txt
- Crear un robots.txt
- Cómo interpreta Google el robots.txt
- Rastreadores de Google
- Funciones de IA y tu web
Ayuda de Search Console
Robots de IA