Noindex: treure pàgines de Google sense perdre les que venen
El noindex és la regla que demana als cercadors que no mostrin una pàgina als resultats. Es posa amb una meta robots al <head> o amb la capçalera HTTP X-Robots-Tag, i Google només el veu si pot rastrejar la pàgina: si el robots.txt la bloqueja, no el llegeix mai. Ben posat, neteja la cerca; oblidat on no toca, fa desaparèixer pàgines que venen.
Per a qui porta un web i vol treure pàgines de Google sense fer mal, o ha perdut trànsit i sospita d'un noindex.
Segons la documentació de Google
Dues maneres de posar-lo i una condició
Pot anar al codi, com una de les meta tags, o a la resposta del servidor. Quan Google el troba, treu la pàgina dels resultats encara que altres webs hi enllacin.
Meta robots
<meta name="robots" content="noindex"> dins del <head>. Amb name="googlebot", només la compleix Google.
X-Robots-Tag
La capçalera X-Robots-Tag: noindex. És la via per a PDF, imatges i vídeos, i a Apache o nginx s'aplica d'un cop a tot un tipus de fitxer.
La condició: l'aranya de Google ha d'entrar a la pàgina per llegir la regla. Si el robots.txt la bloqueja, el noindex no es veu mai i la URL pot continuar sortint si altres pàgines hi enllacen. I Google no admet el noindex dins del robots.txt.
Noindex, robots.txt, canonical o 404: depèn del que vulguis
Cada eina fa una cosa diferent.
On sí que el posaríem
Si ningú no l'ha de trobar des de Google, no cal que hi sigui. I Google avisa que deixar indexat contingut de poca qualitat pot afectar el posicionament del web.
El nostre criteri: amb milers de filtres d'una botiga, Google recomana el robots.txt i no el noindex, que l'obliga a demanar cada URL per descartar-la. Però si ja surten a Google, l'ordre és noindex primer i bloqueig després.
El noindex que et costa trànsit
El visitant no el veu, i pot passar molt de temps sense que ningú el detecti.
noindex, nofollow a totes les pàgines; abans, ho feia amb el robots.txt.El senyal d'alarma, segons Google: si les pàgines indexades baixen sense que pugin els errors, mira si n'has bloquejat amb el robots.txt, un noindex o un inici de sessió.
Com saber si un noindex t'ha tret de Google
Mira l'informe d'indexació
A Search Console, l'informe d'indexació de pàgines agrupa les URL que Google ha deixat fora per un noindex. Si hi surt una pàgina que ven, ja tens el culpable.
Inspecciona la URL
La inspecció d'URL diu si la indexació està permesa i ensenya l'HTML que ha rebut Google. Compte: si el robots.txt la bloqueja, dirà que sí, perquè no ha llegit el noindex.
Prova la versió publicada
La prova en directe mira la pàgina tal com és ara. Si el noindex ja no hi és, demana la indexació; per a moltes URL, envia un sitemap.
Revisa tot el web
Un rastrejador com Screaming Frog troba totes les URL amb noindex i les bloquejades pel robots.txt.
Enganxa la resposta d'una pàgina i mira si Google la pot indexar
Aplica les regles de Google a l'adreça, les capçaleres, el codi i el robots.txt que hi posis.
curl -I seguit de l'adreça.Exemple il·lustratiu. Tot passa al teu navegador i no s'envia res. No executa JavaScript ni veu l'índex de Google: això ho fa la inspecció d'URL.
Res no impedeix que Google la indexi, cosa que no vol dir que ja ho estigui.
Porta noindex: quan Google la rastregi, la traurà dels resultats. Si ha de portar clients, treu-lo i demana la indexació.
Google no hi pot entrar i no llegirà mai el noindex: la URL pot continuar sortint, sense descripció. Si la vols fora, desbloqueja-la.
Google no hi pot entrar, però la URL pot sortir si altres pàgines hi enllacen.
Codi 4xx: Google no la indexa i, si ja hi era, la treu. El noindex ja no hi compta.
Redirecció: Google n'ignora el contingut i processa la URL de destí.
Error de servidor o 429: Google alenteix el rastreig i, si l'error persisteix, treu la URL de l'índex.
Enganxa-hi com a mínim les capçaleres o el codi de la pàgina.
Detall
- Codi HTTP:
- X-Robots-Tag:
- Meta robots:
- Regles contradictòries: Google aplica la més restrictiva.
- Nofollow: Google no seguirà els enllaços d'aquesta pàgina.
- unavailable_after: deixarà de sortir a partir de .
- Regla per a un altre robot (): no afecta la cerca de Google.
- El canonical apunta a una altra URL:
. Google pot indexar aquella en lloc d'aquesta. - Noindex i canonical a una altra URL alhora: per a duplicats, Google recomana només el canonical.
- Regla del robots.txt que s'aplica:
- Sense capçaleres: ni codi HTTP ni X-Robots-Tag.
- Sense codi: ni meta robots ni canonical.
- Sense robots.txt o sense adreça vàlida: bloqueig no comprovat.
Quan el noindex ja no es resol sol
- Search Console exclou pel noindex pàgines de servei o de producte, i no saps qui el posa.
- Has perdut trànsit després d'una migració o d'un canvi de tema.
- Has de treure de Google centenars d'URL sense tocar les que venen.
- El robots.txt, els noindex i els canonicals es contradiuen i no saps quin mana.
A Daimatics, en una auditoria de SEO tècnic, el noindex accidental i les pàgines clau sense indexar s'arreglen primer, amb el robots.txt, els canonicals i els sitemaps.
Dubtes sobre el noindex
Primer, que Google pugui entrar; després, que llegeixi el noindex. Si el robots.txt el bloqueja, no el veurà.
Què és el noindex i per a què serveix?
Quina diferència hi ha entre noindex i nofollow?
Com poso un noindex a WordPress?
Com poso noindex a un PDF?
Quant triga Google a treure una pàgina amb noindex?
Fonts oficials
Google Search Central
- Noindex
- Meta robots i X-Robots-Tag
- Què fa el robots.txt
- Especificació del robots.txt
- URL canòniques
- Codis d'estat HTTP
- Treure pàgines de Google
- Controlar què comparteixes
- Navegació amb filtres
- Atributs dels enllaços
Ajuda de Search Console
WordPress i connectors