Glossari Daimatics · SEO tècnic

Robots.txt: com escriure'l sense tancar la porta a Google

El robots.txt és un fitxer de text a l'arrel del domini que diu a cada rastrejador quines rutes pot visitar. Controla el rastreig, no la indexació: una URL bloquejada pot sortir igualment a Google, sense descripció. Ben escrit, estalvia visites inútils i decideix quins robots d'IA llegeixen el web; una línia equivocada el pot tancar sencer.

Per a qui l'ha d'escriure o revisar: en una migració, amb una botiga plena de filtres o davant dels robots d'IA.

Qui el llegeixCada un, el seu grup
GooglebotCerca de Google i DiscoverCerca
Google-ExtendedGemini i Vertex AIIA
OAI-SearchBotRespostes de cerca de ChatGPTCerca
GPTBotModels d'OpenAIEntrenament

Segons cada empresa

Com s'escriu

Quatre camps i rutes que comencen per barra

Va a l'arrel, en UTF-8 i fins a 500 KiB. Només val per al host, el protocol i el port on és: cada subdomini, el seu.

User-agent: *
Disallow: /cart/
Disallow: /*?sort=
Allow: /cart/help

User-agent: GPTBot
Disallow: /

Sitemap: https://www.example.com/sitemap.xml
A qui

User-agent

Obre un grup per a un robot. L'asterisc val per a tots, excepte els AdsBot de Google, que s'han de nomenar.

Què no

Disallow

La ruta que no es pot rastrejar. Comença per / i distingeix majúscules. Buit, no fa res.

L'excepció

Allow

Obre una ruta dins d'una de tancada.

On és el mapa

Sitemap

L'adreça completa del sitemap, amb https://. No pertany a cap grup.

La resta, Google la ignora: Crawl-delay, noindex i qualsevol línia mal escrita. Si vols treure una pàgina de la cerca, el lloc és la mateixa pàgina, amb un noindex.

Com el llegeix Google

Quina regla mana quan dues xoquen

01

Tria un sol grup

El del User-agent més específic per al robot; si no n'hi ha, el de l'asterisc. Dos grups del mateix robot s'ajunten.

02

Busca les regles que coincideixen

Des del principi de la ruta, amb dos comodins: * per a qualsevol seqüència i $ per al final. /blog també tanca /blog-antic.

03

Mana la més llarga

Guanya la de ruta més llarga, comodins inclosos. En empat, la menys restrictiva: l'Allow.

04

Si no n'hi ha cap

La ruta es pot rastrejar. I si el fitxer dona un 404, Google entén que pot rastrejar-ho tot.

Ruta i reglesQuè manaPer què
/page amb Allow: /p i Disallow: /Allow: es pot rastrejarRuta més llarga.
/folder/page amb Allow: /folder i Disallow: /folderAllow: es pot rastrejarEmpat: la menys restrictiva.
/page.htm amb Allow: /page i Disallow: /*.htmDisallow: bloquejadaAmb el comodí, és més llarga.

Exemples de l'especificació de Google.

Quan és un error

Les línies que et poden deixar fora de Google

On sol fallar
Disallow: / al web publicat. Tanca tot el lloc i sol arribar amb la còpia de l'entorn de proves el dia del llançament.
Un error de servidor en el mateix robots.txt. Google atura el rastreig durant 12 hores; després fa servir l'última còpia bona fins a 30 dies.
Bloquejar CSS i JavaScript. Google els necessita per entendre com és la pàgina.
Bloquejar per treure una pàgina de la cerca. Si altres webs hi enllacen, la URL pot continuar sortint sense descripció.

El nostre criteri: amb milers d'URL de filtres o de cerca interna, és l'eina bona per no gastar el rastreig. I revisa'l a cada migració o canvi de tema, amb la versió d'abans guardada.

Robots d'IA

Cerca o entrenament: bloqueja només el que vols

Cada empresa separa el robot de les respostes del que recull textos per entrenar models.

User-agentPer a què el fan servirSi el bloqueges
GooglebotLa Cerca de Google, amb les funcions d'IAGoogle no pot rastrejar-les.
Google-ExtendedEntrenar Gemini i fonamentar respostes a Gemini i Vertex AINo et treu de la Cerca de Google ni és un senyal de rànquing.
OAI-SearchBotEls resultats de la cerca de ChatGPTNo surts a les respostes de cerca de ChatGPT.
GPTBotEntrenar els models d'OpenAIEl contingut queda fora de l'entrenament.
ClaudeBotEntrenar els models d'AnthropicEl contingut futur queda fora de l'entrenament.
Claude-SearchBotMillorar les respostes de cerca de ClaudePots perdre visibilitat a les respostes de Claude.
PerplexityBotMostrar i enllaçar webs a Perplexity; no entrena modelsPots perdre visibilitat a Perplexity.

El nostre criteri: si vols sortir a les respostes, deixa entrar els robots de cerca; l'entrenament és una decisió de negoci. I no cal cap fitxer especial per a la IA: per a Google n'hi ha prou que la pàgina estigui indexada.

Com es revisa

L'informe de robots.txt de Search Console

Ensenya els robots.txt que Google ha trobat als 20 hosts principals del web. Només surt a les propietats de domini o de prefix sense ruta.

01

Mira l'estat

Si Google l'ha pogut llegir, quan i quina mida té.

02

Llegeix els problemes

Els errors i avisos que Google hi ha trobat.

03

Demana'n un nou rastreig

Google en guarda una còpia fins a 24 hores. Després d'un canvi urgent, demana que el torni a llegir.

04

Comprova la pàgina

La inspecció d'URL diu si una adreça està bloquejada. Per a moltes rutes, l'eina d'aquí sota o Screaming Frog.

L'eina

Provador de robots.txt: qui pot entrar i per quina regla

Enganxa el fitxer, tria el robot i escriu les rutes. Aplica les regles de Google i, de passada, revisa la sintaxi. Per saber si una pàgina porta noindex, hi ha el comprovador de l'entrada Noindex.

El trobaràs a l'adreça del web seguida de /robots.txt.
El robot
Des de la barra, amb els paràmetres, o l'adreça sencera.

El resultat

Grup que llegeixUser-agent: *

Hi ha rutes bloquejades: comprova que cap no hagi de sortir a la cerca.

  • /cart/BloquejadaMana Disallow: /cart/
  • /cart/helpPot entrarMana Allow: /cart/help
  • /shoes?sort=priceBloquejadaMana Disallow: /*?sort=
  • /blog/guidePot entrar

La revisió del fitxer

  • Cap problema de sintaxi a la vista.

Exemple il·lustratiu amb l'adreça de proves de Google, example.com. Es calcula al teu navegador: no s'envia enlloc. Altres robots poden interpretar el fitxer d'una altra manera.

Quan et cal ajuda

Quan el robots.txt ja no és una línia

  • Search Console dona pàgines que venen com a bloquejades pel robots.txt.
  • Has migrat el web o canviat de tema i el trànsit orgànic ha baixat.
  • La botiga genera milers d'URL de filtres i Google s'hi entreté.
  • No saps quins robots d'IA deixes entrar ni qui ho va decidir.

Quan fem una auditoria de SEO tècnic a Daimatics, el robots.txt es revisa amb els sitemaps, els noindex i els canonicals: han de dir el mateix a Google.

Preguntes freqüents

Dubtes sobre el robots.txt

La regla

Decideix per on passa el robot, no què surt a Google.

Què és el robots.txt i on es posa?
És un fitxer de text pla, en UTF-8, que es posa a l'arrel del domini amb aquest nom exacte, com example.com/robots.txt. Diu a cada rastrejador quines rutes pot visitar. Només val per al host, el protocol i el port on és, de manera que cada subdomini necessita el seu. Google el troba sol, sense que l'hagis d'enviar, i en guarda una còpia fins a 24 hores.
El robots.txt serveix per treure una pàgina de Google?
No. Controla el rastreig, no la indexació: si altres pàgines enllacen una URL bloquejada, Google la pot mostrar igualment, sense descripció. Per treure-la, la pàgina ha de portar un noindex i Google l'ha de poder rastrejar per llegir-lo. Si el contingut és privat, el que el protegeix és una contrasenya. El robots.txt serveix per no gastar rastreig en URL sense valor.
Com bloquejo ChatGPT al robots.txt?
Depèn del que vulguis evitar. Perquè el contingut no s'usi per entrenar models d'OpenAI, un grup User-agent: GPTBot amb Disallow: /. Per no sortir a les respostes de cerca de ChatGPT, el mateix amb OAI-SearchBot. Són independents: pots bloquejar l'entrenament i continuar a la cerca. OpenAI avisa que ChatGPT-User, que visita pàgines quan un usuari ho demana, pot no seguir el robots.txt.
Bloquejar Google-Extended em treu de Google?
No. Google diu que Google-Extended no afecta la presència a la Cerca de Google ni és un senyal de rànquing. Controla si el contingut es pot fer servir per entrenar futures versions de Gemini i per fonamentar respostes a les aplicacions de Gemini i a Vertex AI. No és un robot a part: el rastreig el fan els robots habituals de Google, i el token només en limita l'ús.
Quant triga Google a aplicar un canvi al robots.txt?
Google en guarda una còpia normalment fins a 24 hores, així que un canvi pot trigar un dia a notar-se. Si has desbloquejat pàgines importants o has arreglat un error greu, pots demanar un nou rastreig del fitxer des de l'informe de robots.txt de Search Console. Després, amb la inspecció d'URL, comprova que la pàgina que t'importa ja no surt bloquejada.
Escrit per David Nogués, fundador i CEO de Daimatics, amb més de 20 anys de trajectòria professional en l'àmbit digital. Actualitzat el

Fonts oficials

Google Search Central

Ajuda de Search Console

Robots d'IA