Glosario Daimatics · SEO técnico

Robots.txt: cómo escribirlo sin cerrarle la puerta a Google

El robots.txt es un archivo de texto en la raíz del dominio que le dice a cada rastreador qué rutas puede visitar. Controla el rastreo, no la indexación: una URL bloqueada puede seguir saliendo en Google, sin descripción. Bien escrito, ahorra visitas inútiles y decide qué robots de IA leen el sitio web; una línea equivocada puede cerrarlo entero.

Para quien tenga que escribirlo o revisarlo: en una migración, con una tienda llena de filtros o ante los robots de IA.

Quién lo leeCada uno, su grupo
GooglebotBúsqueda de Google y DiscoverBúsqueda
Google-ExtendedGemini y Vertex AIIA
OAI-SearchBotRespuestas de búsqueda de ChatGPTBúsqueda
GPTBotModelos de OpenAIEntrenamiento

Según cada empresa

Cómo se escribe

Cuatro campos y rutas que empiezan por barra

Va en la raíz, en UTF-8 y hasta 500 KiB. Solo vale para el host, el protocolo y el puerto donde está: cada subdominio, el suyo.

User-agent: *
Disallow: /cart/
Disallow: /*?sort=
Allow: /cart/help

User-agent: GPTBot
Disallow: /

Sitemap: https://www.example.com/sitemap.xml
A quién

User-agent

Abre un grupo para un robot. El asterisco vale para todos, excepto los AdsBot de Google, que se han de nombrar.

Qué no

Disallow

La ruta que no se puede rastrear. Empieza por / y distingue mayúsculas. Vacío, no hace nada.

La excepción

Allow

Abre una ruta dentro de una cerrada.

Dónde está el mapa

Sitemap

La dirección completa del sitemap, con https://. No pertenece a ningún grupo.

El resto, Google lo ignora: Crawl-delay, noindex y cualquier línea mal escrita. Si quieres sacar una página de la búsqueda, el sitio es la propia página, con un noindex.

Cómo lo lee Google

Qué regla manda cuando dos chocan

01

Elige un solo grupo

El del User-agent más específico para el robot; si no hay ninguno, el del asterisco. Dos grupos del mismo robot se juntan.

02

Busca las reglas que coinciden

Desde el principio de la ruta, con dos comodines: * para cualquier secuencia y $ para el final. /blog también cierra /blog-antic.

03

Manda la más larga

Gana la de ruta más larga, comodines incluidos. En empate, la menos restrictiva: el Allow.

04

Si no hay ninguna

La ruta se puede rastrear. Y si el archivo da un 404, Google entiende que puede rastrearlo todo.

Ruta y reglasQué mandaPor qué
/page con Allow: /p i Disallow: /Allow: se puede rastrearRuta más larga.
/folder/page con Allow: /folder i Disallow: /folderAllow: se puede rastrearEmpate: la menos restrictiva.
/page.htm con Allow: /page i Disallow: /*.htmDisallow: bloqueadaCon el comodín, es más larga.

Ejemplos de la especificación de Google.

Cuándo es un error

Las líneas que te pueden dejar fuera de Google

Dónde suele fallar
Disallow: / en la web publicada. Cierra todo el sitio y suele llegar con la copia del entorno de pruebas el día del lanzamiento.
Un error de servidor en el propio robots.txt. Google detiene el rastreo durante 12 horas; después usa la última copia buena hasta 30 días.
Bloquear CSS y JavaScript. Google los necesita para entender cómo es la página.
Bloquear para sacar una página de la búsqueda. Si otros sitios la enlazan, la URL puede seguir saliendo sin descripción.

Nuestro criterio: con miles de URL de filtros o de búsqueda interna, es la herramienta buena para no gastar el rastreo. Y revísalo en cada migración o cambio de tema, con la versión de antes guardada.

Robots de IA

Búsqueda o entrenamiento: bloquea solo lo que quieres

Cada empresa separa el robot de las respuestas del que recoge textos para entrenar modelos.

User-agentPara qué lo usanSi lo bloqueas
GooglebotLa Búsqueda de Google, con las funciones de IAGoogle no puede rastrearlas.
Google-ExtendedEntrenar Gemini y fundamentar respuestas en Gemini y Vertex AINo te saca de la Búsqueda de Google ni es una señal de ranking.
OAI-SearchBotLos resultados de la búsqueda de ChatGPTNo sales en las respuestas de búsqueda de ChatGPT.
GPTBotEntrenar los modelos de OpenAIEl contenido queda fuera del entrenamiento.
ClaudeBotEntrenar los modelos de AnthropicEl contenido futuro queda fuera del entrenamiento.
Claude-SearchBotMejorar las respuestas de búsqueda de ClaudePuedes perder visibilidad en las respuestas de Claude.
PerplexityBotMostrar y enlazar sitios en Perplexity; no entrena modelosPuedes perder visibilidad en Perplexity.

Nuestro criterio: si quieres salir en las respuestas, deja entrar a los robots de búsqueda; el entrenamiento es una decisión de negocio. Y no hace falta ningún archivo especial para la IA: para Google basta con que la página esté indexada.

Cómo se revisa

El informe de robots.txt de Search Console

Enseña los robots.txt que Google ha encontrado en los 20 hosts principales del sitio. Solo sale en las propiedades de dominio o de prefijo sin ruta.

01

Mira el estado

Si Google ha podido leerlo, cuándo y qué tamaño tiene.

02

Lee los problemas

Los errores y avisos que Google ha encontrado.

03

Pide un nuevo rastreo

Google guarda una copia hasta 24 horas. Después de un cambio urgente, pide que vuelva a leerlo.

04

Comprueba la página

La inspección de URLs dice si una dirección está bloqueada. Para muchas rutas, la herramienta de aquí abajo o Screaming Frog.

La herramienta

Probador de robots.txt: quién puede entrar y por qué regla

Pega el archivo, elige el robot y escribe las rutas. Aplica las reglas de Google y, de paso, revisa la sintaxis. Para saber si una página lleva noindex, está el comprobador de la entrada Noindex.

Lo encontrarás en la dirección del sitio seguida de /robots.txt.
El robot
Desde la barra, con los parámetros, o la dirección entera.

El resultado

Grupo que leeUser-agent: *

Hay rutas bloqueadas: comprueba que ninguna tenga que salir en la búsqueda.

  • /cart/BloqueadaManda Disallow: /cart/
  • /cart/helpPuede entrarManda Allow: /cart/help
  • /shoes?sort=priceBloqueadaManda Disallow: /*?sort=
  • /blog/guidePuede entrar

La revisión del archivo

  • Ningún problema de sintaxis a la vista.

Ejemplo ilustrativo con la dirección de pruebas de Google, example.com. Se calcula en tu navegador: no se envía a ningún sitio. Otros robots pueden interpretar el archivo de otra manera.

Cuándo necesitas ayuda

Cuando el robots.txt ya no es una línea

  • Search Console da páginas que aparecen como bloqueadas por el robots.txt.
  • Has migrado el sitio o cambiado de tema y el tráfico orgánico ha bajado.
  • La tienda genera miles de URL de filtros y Google se entretiene en ellas.
  • No sabes qué robots de IA dejas entrar ni quién lo decidió.

Cuando hacemos una auditoría de SEO técnico a Daimatics, el robots.txt se revisa con los sitemaps, los noindex y los canonicals: tienen que decir lo mismo a Google.

Preguntas frecuentes

Dudas sobre el robots.txt

La regla

Decide por dónde pasa el robot, no qué sale en Google.

¿Qué es el robots.txt y dónde se pone?
Es un archivo de texto plano, en UTF-8, que se pone en la raíz del dominio con este nombre exacto, como example.com/robots.txt. Le dice a cada rastreador qué rutas puede visitar. Solo vale para el host, el protocolo y el puerto donde está, de manera que cada subdominio necesita el suyo. Google lo encuentra solo, sin que tengas que enviarlo, y guarda una copia de él hasta 24 horas.
¿El robots.txt sirve para sacar una página de Google?
No. Controla el rastreo, no la indexación: si otras páginas enlazan una URL bloqueada, Google puede mostrarla igualmente, sin descripción. Para sacarla, la página tiene que llevar un noindex y Google tiene que poder rastrearla para leerlo. Si el contenido es privado, lo que lo protege es una contraseña. El robots.txt sirve para no gastar rastreo en URL sin valor.
¿Cómo bloqueo ChatGPT en el robots.txt?
Depende de lo que quieras evitar. Para que el contenido no se use para entrenar modelos de OpenAI, un grupo User-agent: GPTBot con Disallow: /. Para no salir en las respuestas de búsqueda de ChatGPT, lo mismo con OAI-SearchBot. Son independientes: puedes bloquear el entrenamiento y seguir en la búsqueda. OpenAI avisa de que ChatGPT-User, que visita páginas cuando un usuario lo pide, puede no seguir el robots.txt.
¿Bloquear Google-Extended me saca de Google?
No. Google dice que Google-Extended no afecta a la presencia en la Búsqueda de Google ni es una señal de ranking. Controla si el contenido se puede usar para entrenar futuras versiones de Gemini y para fundamentar respuestas en las aplicaciones de Gemini y en Vertex AI. No es un robot aparte: el rastreo lo hacen los robots habituales de Google, y el token solo limita su uso.
¿Cuánto tarda Google en aplicar un cambio en el robots.txt?
Google guarda una copia normalmente hasta 24 horas, así que un cambio puede tardar un día en notarse. Si has desbloqueado páginas importantes o has arreglado un error grave, puedes pedir un nuevo rastreo del archivo desde el informe de robots.txt de Search Console. Después, con la inspección de URLs, comprueba que la página que te importa ya no sale bloqueada.
Escrito por David Nogués, fundador y CEO de Daimatics, con más de 20 años de trayectoria profesional en el ámbito digital. Actualizado el

Fuentes oficiales

Google Search Central

Ayuda de Search Console

Robots de IA