
Si tienes un archivo robots.txt en tu web y das por hecho que Google lo respeta al pie de la letra, puede que te lleves una sorpresa. John Mueller, representante de Google, ha explicado recientemente en Reddit un error muy común que provoca que Googlebot ignore las directivas de ese archivo, con consecuencias directas para el posicionamiento. El caso surgió a raíz de un problema de spam en la barra de búsqueda de una tienda en Shopify, pero según la fuente, el error puede ocurrirle a cualquier webmaster.
Qué es el spam en la barra de búsqueda y por qué genera páginas indeseadas
El ataque de spam en buscadores internos de webs es una técnica conocida en el mundo del SEO técnico. Según se detalla en el hilo de Reddit donde surgió el debate, los spammers lanzan búsquedas con términos o URLs de su nicho a través del buscador interno de una web, lo que hace que se generen automáticamente URLs únicas con ese contenido basura. Esas páginas pueden acabar siendo rastreadas e indexadas por Google.
En el caso concreto, el buscador interno de una tienda Shopify estaba generando páginas de resultados de búsqueda en respuesta a esas consultas spam. El propietario había intentado solucionar el problema añadiendo una regla en el robots.txt para bloquear el acceso de Google a esas URLs, pero Google seguía indexándolas. Ahí es donde entraba el verdadero problema.
El error en robots.txt que hace que Google ignore tus reglas
Según explicó John Mueller al revisar el archivo robots.txt del sitio afectado, el problema estaba en cómo estaban estructuradas las reglas para distintos user-agents. El archivo incluía una sección específica para user-agent: Googlebot y, más adelante, una sección genérica con user-agent: * donde estaba la regla que bloqueaba las páginas de búsqueda.
De acuerdo con lo explicado por Mueller, cuando existe una sección específica para Googlebot, Google solo aplica las reglas de esa sección y pasa por alto completamente las del bloque genérico user-agent: *. Es decir, la regla que bloqueaba las páginas de búsqueda nunca llegaba a ejecutarse para Googlebot porque estaba en el bloque equivocado.
Según la fuente, la lógica detrás de este comportamiento tiene sentido: el sistema está diseñado para que las reglas más específicas tengan prioridad sobre las generales, lo que permite a los administradores dar instrucciones distintas a cada crawler. El problema surge cuando no se es consciente de esta jerarquía y se mezclan reglas en bloques diferentes creyendo que todas se aplican a la vez.
Cómo debería estructurarse correctamente el robots.txt
Mueller propuso en su respuesta una solución clara: si quieres que Googlebot siga todas las reglas del bloque genérico, debes copiarlas también en la sección específica de Googlebot, o bien agrupar todos los bots bajo las mismas directivas usando varias líneas de user-agent seguidas antes de los disallow. Un ejemplo de estructura correcta sería:
user-agent: googlebotuser-agent: otherbotuser-agent: imgsrcdisallow: /ruta-bloqueada
Con esta estructura, las mismas reglas se aplican a todos los bots listados sin riesgo de que uno de ellos quede excluido por error. Según los datos facilitados por la fuente, esta es la forma más segura de garantizar que las directivas llegan a todos los crawlers que se quieren controlar.
Por qué robots.txt no es suficiente para evitar la indexación
Más allá del error de configuración, el caso destaca otra realidad importante del SEO técnico que muchos pasan por alto: robots.txt controla el rastreo, no la indexación. Según se explica en la fuente original, Google puede indexar una URL aunque Googlebot no la haya rastreado, por ejemplo si hay enlaces externos apuntando a ella.
Por eso, para páginas que no deben aparecer en Google bajo ningún concepto, la solución más efectiva es usar la etiqueta meta robots con el valor noindex directamente en el HTML de la página. Esto le indica a Google explícitamente que no incluya esa URL en sus resultados, independientemente de lo que diga el robots.txt.
Cómo proteger una tienda Shopify del spam en búsquedas internas
Para los administradores de tiendas en Shopify, la plataforma ofrece una solución específica documentada en su propio centro de ayuda. De acuerdo con las instrucciones de Shopify recogidas en la fuente, se puede añadir una directiva noindex a todas las páginas de resultados de búsqueda modificando el archivo theme.liquid del tema activo. El código a insertar en la sección <head> es condicional: solo aplica el noindex cuando la plantilla activa es la de búsqueda.
Según los datos facilitados, es importante que esta solución se combine correctamente con el robots.txt: si se bloquea el rastreo de las páginas de búsqueda con robots.txt, Googlebot no podrá leer la etiqueta noindex, lo que puede generar una situación contradictoria. Lo recomendable es permitir el rastreo pero bloquear la indexación mediante el noindex en el HTML.
Cómo proteger un WordPress del mismo problema
En el caso de WordPress, la solución es todavía más sencilla. Según se indica en la fuente, los principales plugins de SEO como Yoast SEO, Rank Math y AIOSEO aplican noindex a las páginas de resultados de búsqueda interna de forma automática y predeterminada. Si usas alguno de estos plugins, probablemente ya estás protegido sin haber hecho nada.
Además, según la misma fuente, algunos constructores de páginas y temas populares como Divi también tienen mecanismos que evitan la generación de URLs con contenido spam en respuesta a búsquedas, mostrando en su lugar un mensaje de que no se encontraron resultados. Esto evita que se creen páginas indexables con contenido basura en primer lugar.
Qué se puede aprender de este caso para el SEO técnico
El caso descrito por John Mueller es un buen recordatorio de que los archivos de configuración técnica como robots.txt tienen sus propias reglas de precedencia que no siempre resultan intuitivas. Un error aparentemente menor en la estructura del archivo puede invalidar directivas importantes y dejar expuesto el sitio a problemas de indexación que son difíciles de detectar a simple vista.
Según la valoración recogida en la fuente, conocer las especificaciones oficiales del protocolo robots.txt es esencial para cualquier profesional del SEO técnico. No basta con añadir líneas al archivo y asumir que funcionan: hay que entender cómo interactúan entre sí las distintas secciones y qué bot aplica qué reglas en cada momento. En un entorno donde Google puede ignorar silenciosamente parte de tus instrucciones, revisar periódicamente la configuración del robots.txt debería ser una tarea rutinaria.
Fuente: https://www.searchenginejournal.com/google-says-why-it-may-ignore-robots-txt-and-negatively-impact-seo/583475/