Noindex: sacar páginas de Google sin perder las que venden
El noindex es la regla que pide a los buscadores que no muestren una página en los resultados. Se pone con una meta robots en el <head> o con la cabecera HTTP X-Robots-Tag, y Google solo lo ve si puede rastrear la página: si el robots.txt la bloquea, no lo lee nunca. Bien puesto, limpia la búsqueda; olvidado donde no toca, hace desaparecer páginas que venden.
Para quien lleva una web y quiere sacar páginas de Google sin hacer daño, o ha perdido tráfico y sospecha de un noindex.
Según la documentación de Google
Dos maneras de ponerlo y una condición
Puede ir en el código, como una de las meta tags, o en la respuesta del servidor. Cuando Google lo encuentra, saca la página de los resultados aunque otras webs enlacen a ella.
Meta robots
<meta name="robots" content="noindex"> dentro del <head>. Con name="googlebot", solo la cumple Google.
X-Robots-Tag
La cabecera X-Robots-Tag: noindex. Es la vía para PDF, imágenes y vídeos, y en Apache o nginx se aplica de una vez a todo un tipo de archivo.
La condición: elaraña de Google tiene que entrar en la página para leer la regla. Si el robots.txt la bloquea, el noindex no se ve nunca y la URL puede seguir saliendo si otras páginas enlazan a ella. Y Google no admite el noindex dentro del robots.txt.
Noindex, robots.txt, canonical o 404: depende de lo que quieras
Cada herramienta hace una cosa diferente.
Dónde sí que lo pondríamos
Si nadie lo tiene que encontrar desde Google, no hace falta que esté. Y Google avisa de que dejar indexado contenido de poca calidad puede afectar al posicionamiento de la web.
Nuestro criterio: con miles de filtros de una tienda, Google recomienda el robots.txt y no el noindex, que le obliga a pedir cada URL para descartarla. Pero si ya salen en Google, el orden es noindex primero y bloqueo después.
El noindex que te cuesta tráfico
El visitante no lo ve, y puede pasar mucho tiempo sin que nadie lo detecte.
noindex, nofollow en todas las páginas; antes, lo hacía con el robots.txt.La señal de alarma, según Google: si las páginas indexadas bajan sin que suban los errores, mira si has bloqueado alguna con el robots.txt, un noindex o un inicio de sesión.
Cómo saber si un noindex te ha sacado de Google
Mira el informe de indexación
En Search Console, el informe de indexación de páginas agrupa las URL que Google ha dejado fuera por un noindex. Si sale ahí una página que vende, ya tienes al culpable.
Inspecciona la URL
La inspección de URLs dice si la indexación está permitida y enseña el HTML que ha recibido Google. Ojo: si el robots.txt la bloquea, dirá que sí, porque no ha leído el noindex.
Prueba la versión publicada
La prueba en directo mira la página tal como es ahora. Si el noindex ya no está, solicita la indexación; para muchas URL, envía un sitemap.
Revisa toda la web
Un rastreador como Screaming Frog encuentra todas las URL con noindex y las bloqueadas por el robots.txt.
Pega la respuesta de una página y mira si Google la puede indexar
Aplica las reglas de Google a la dirección, las cabeceras, el código y el robots.txt que pongas.
curl -I seguido de la dirección.Ejemplo ilustrativo. Todo pasa en tu navegador y no se envía nada. No ejecuta JavaScript ni ve el índice de Google: eso lo hace la inspección de URLs.
Nada impide que Google la indexe, lo que no significa que ya lo esté.
Lleva noindex: cuando Google la rastree, la sacará de los resultados. Si tiene que traer clientes, quítalo y solicita la indexación.
Google no puede entrar en ella y no leerá nunca el noindex: la URL puede seguir saliendo, sin descripción. Si la quieres fuera, desbloquéala.
Google no puede entrar en ella, pero la URL puede salir si otras páginas enlazan a ella.
Código 4xx: Google no la indexa y, si ya estaba, la saca. El noindex ya no cuenta ahí.
Redirección: Google ignora su contenido y procesa la URL de destino.
Error de servidor o 429: Google ralentiza el rastreo y, si el error persiste, saca la URL del índice.
Pega ahí como mínimo las cabeceras o el código de la página.
Detalle
- Código HTTP:
- X-Robots-Tag:
- Meta robots:
- Reglas contradictorias: Google aplica la más restrictiva.
- Nofollow: Google no seguirá los enlaces de esta página.
- unavailable_after: dejará de salir a partir de .
- Regla para otro robot (): no afecta a la búsqueda de Google.
- El canonical apunta a otra URL:
. Google puede indexar aquella en lugar de esta. - Noindex y canonical a otra URL a la vez: para duplicados, Google recomienda solo el canonical.
- Regla del robots.txt que se aplica:
- Sin cabeceras: ni código HTTP ni X-Robots-Tag.
- Sin código: ni meta robots ni canonical.
- Sin robots.txt o sin dirección válida: bloqueo no comprobado.
Cuando el noindex ya no se resuelve solo
- Search Console excluye por noindex páginas de servicio o de producto, y no sabes quién lo pone.
- Has perdido tráfico después de una migración o de un cambio de tema.
- Tienes que sacar de Google cientos de URL sin tocar las que venden.
- El robots.txt, los noindex y los canonicals se contradicen y no sabes cuál manda.
En Daimatics, en una auditoría de SEO técnico, el noindex accidental y las páginas clave sin indexar se arreglan primero, con el robots.txt, los canonicals y los sitemaps.
Dudas sobre el noindex
Primero, que Google pueda entrar; después, que lea el noindex. Si el robots.txt lo bloquea, no lo verá.
¿Qué es el noindex y para qué sirve?
¿Qué diferencia hay entre noindex y nofollow?
¿Cómo pongo un noindex en WordPress?
¿Cómo pongo noindex en un PDF?
¿Cuánto tarda Google en sacar una página con noindex?
Fuentes oficiales
Google Search Central
- Noindex
- Meta robots y X-Robots-Tag
- Qué hace el robots.txt
- Especificación del robots.txt
- URL canónicas
- Códigos de estado HTTP
- Sacar páginas de Google
- Controlar qué compartes
- Navegación con filtros
- Atributos de los enlaces
Ayuda de Search Console
WordPress y plugins