Robots.txt: com escriure'l sense tancar la porta a Google
El robots.txt és un fitxer de text a l'arrel del domini que diu a cada rastrejador quines rutes pot visitar. Controla el rastreig, no la indexació: una URL bloquejada pot sortir igualment a Google, sense descripció. Ben escrit, estalvia visites inútils i decideix quins robots d'IA llegeixen el web; una línia equivocada el pot tancar sencer.
Per a qui l'ha d'escriure o revisar: en una migració, amb una botiga plena de filtres o davant dels robots d'IA.
Segons cada empresa
Quatre camps i rutes que comencen per barra
Va a l'arrel, en UTF-8 i fins a 500 KiB. Només val per al host, el protocol i el port on és: cada subdomini, el seu.
User-agent: *
Disallow: /cart/
Disallow: /*?sort=
Allow: /cart/help
User-agent: GPTBot
Disallow: /
Sitemap: https://www.example.com/sitemap.xml
User-agent
Obre un grup per a un robot. L'asterisc val per a tots, excepte els AdsBot de Google, que s'han de nomenar.
Disallow
La ruta que no es pot rastrejar. Comença per / i distingeix majúscules. Buit, no fa res.
Allow
Obre una ruta dins d'una de tancada.
Sitemap
L'adreça completa del sitemap, amb https://. No pertany a cap grup.
La resta, Google la ignora: Crawl-delay, noindex i qualsevol línia mal escrita. Si vols treure una pàgina de la cerca, el lloc és la mateixa pàgina, amb un noindex.
Quina regla mana quan dues xoquen
Tria un sol grup
El del User-agent més específic per al robot; si no n'hi ha, el de l'asterisc. Dos grups del mateix robot s'ajunten.
Busca les regles que coincideixen
Des del principi de la ruta, amb dos comodins: * per a qualsevol seqüència i $ per al final. /blog també tanca /blog-antic.
Mana la més llarga
Guanya la de ruta més llarga, comodins inclosos. En empat, la menys restrictiva: l'Allow.
Si no n'hi ha cap
La ruta es pot rastrejar. I si el fitxer dona un 404, Google entén que pot rastrejar-ho tot.
/page amb Allow: /p i Disallow: /Allow: es pot rastrejarRuta més llarga./folder/page amb Allow: /folder i Disallow: /folderAllow: es pot rastrejarEmpat: la menys restrictiva./page.htm amb Allow: /page i Disallow: /*.htmDisallow: bloquejadaAmb el comodí, és més llarga.Exemples de l'especificació de Google.
Les línies que et poden deixar fora de Google
Disallow: / al web publicat. Tanca tot el lloc i sol arribar amb la còpia de l'entorn de proves el dia del llançament.El nostre criteri: amb milers d'URL de filtres o de cerca interna, és l'eina bona per no gastar el rastreig. I revisa'l a cada migració o canvi de tema, amb la versió d'abans guardada.
Cerca o entrenament: bloqueja només el que vols
Cada empresa separa el robot de les respostes del que recull textos per entrenar models.
El nostre criteri: si vols sortir a les respostes, deixa entrar els robots de cerca; l'entrenament és una decisió de negoci. I no cal cap fitxer especial per a la IA: per a Google n'hi ha prou que la pàgina estigui indexada.
L'informe de robots.txt de Search Console
Ensenya els robots.txt que Google ha trobat als 20 hosts principals del web. Només surt a les propietats de domini o de prefix sense ruta.
Mira l'estat
Si Google l'ha pogut llegir, quan i quina mida té.
Llegeix els problemes
Els errors i avisos que Google hi ha trobat.
Demana'n un nou rastreig
Google en guarda una còpia fins a 24 hores. Després d'un canvi urgent, demana que el torni a llegir.
Comprova la pàgina
La inspecció d'URL diu si una adreça està bloquejada. Per a moltes rutes, l'eina d'aquí sota o Screaming Frog.
Provador de robots.txt: qui pot entrar i per quina regla
Enganxa el fitxer, tria el robot i escriu les rutes. Aplica les regles de Google i, de passada, revisa la sintaxi. Per saber si una pàgina porta noindex, hi ha el comprovador de l'entrada Noindex.
/robots.txt.El resultat
Enganxa el robots.txt i com a mínim una ruta.
Aquest robot té tancat tot el web: la regla que mana per a la portada és un Disallow.
Pot rastrejar totes les rutes que has posat.
Hi ha rutes bloquejades: comprova que cap no hagi de sortir a la cerca.
Totes les rutes que has posat estan bloquejades per a aquest robot.
Pot entrarBloquejadaManaPot entrarBloquejadaManaPot entrarBloquejadaManaPot entrarBloquejadaManaPot entrarBloquejadaManaPot entrarBloquejadaMana
La revisió del fitxer
- Cap problema de sintaxi a la vista.
- Regles abans de cap User-agent. Google no les aplica a ningú.
- Línies que Google no reconeix:
. Revisa si estan mal escrites. - Rutes que no comencen per barra:
. - Bloqueges fitxers CSS o JavaScript. Google els necessita per entendre les pàgines.
- Passa de 500 KiB. Google ignora tot el que hi ha després del límit.
- Hi ha un noindex. Google no l'admet al robots.txt: posa'l a la pàgina.
- Hi ha un Crawl-delay. Google l'ignora; ClaudeBot, per exemple, sí que el respecta.
- Sitemap amb adreça relativa. Ha de ser l'adreça completa, amb https://.
- Sense línia Sitemap. No és obligatòria, però és la manera d'indicar on és.
- Google-Extended no et treu de la cerca. No és un robot a part: només limita l'ús per a Gemini.
- Només es proven les sis primeres rutes.
Exemple il·lustratiu amb l'adreça de proves de Google, example.com. Es calcula al teu navegador: no s'envia enlloc. Altres robots poden interpretar el fitxer d'una altra manera.
Quan el robots.txt ja no és una línia
- Search Console dona pàgines que venen com a bloquejades pel robots.txt.
- Has migrat el web o canviat de tema i el trànsit orgànic ha baixat.
- La botiga genera milers d'URL de filtres i Google s'hi entreté.
- No saps quins robots d'IA deixes entrar ni qui ho va decidir.
Quan fem una auditoria de SEO tècnic a Daimatics, el robots.txt es revisa amb els sitemaps, els noindex i els canonicals: han de dir el mateix a Google.
Dubtes sobre el robots.txt
Decideix per on passa el robot, no què surt a Google.
Què és el robots.txt i on es posa?
El robots.txt serveix per treure una pàgina de Google?
Com bloquejo ChatGPT al robots.txt?
Bloquejar Google-Extended em treu de Google?
Quant triga Google a aplicar un canvi al robots.txt?
Fonts oficials
Google Search Central
- Introducció al robots.txt
- Crear un robots.txt
- Com interpreta Google el robots.txt
- Rastrejadors de Google
- Funcions d'IA i el teu web
Ajuda de Search Console
Robots d'IA