
Cloudflare asegura que Perplexity emplea crawlers ocultos para evadir las directivas de no rastreo en millones de sitios web. Esta polémica pone de manifiesto los riesgos en la relación entre grandes modelos de inteligencia artificial y la privacidad en internet, tema cada vez más relevante para usuarios y empresas.
Cloudflare denuncia el uso de crawlers no declarados en la web
Según información difundida por Cloudflare, Perplexity estaría usando robots digitales «sigilosos» que acceden a páginas web pasando desapercibidos para los mecanismos habituales que bloquean el rastreo.
La compañía de servicios de internet afirma que parte del tráfico asociado a Perplexity ignora de forma deliberada los archivos robots.txt, que indican formalmente lo que un crawler puede o no puede indexar.
Cloudflare sostiene que, en lugar de identificarse claramente como robot, parte de estas solicitudes llegan disfrazadas de tráfico de usuario común, dificultando su detección.
De acuerdo con sus análisis, estos bots provienen de proveedores en la nube como Amazon Web Services e incluso se disfrazan como navegadores conocidos, como Google Chrome.
Según la fuente, esta técnica permite a Perplexity recopilar contenidos que han sido bloqueados para otros rastreadores. Para los responsables de sitios web afectados, esto puede significar una violación del acuerdo tácito que existe en la web sobre el respeto a las directivas de no rastreo.
No es la primera vez que se detecta esta clase de prácticas en el sector de la inteligencia artificial, pero sí destaca la denuncia pública realizada por una empresa de la magnitud de Cloudflare, que protege a millones de webs en todo el mundo.
La respuesta de Perplexity y el debate sobre la inteligencia artificial
Perplexity, por su parte, ha admitido que utiliza «múltiples sistemas» para recuperar información de la web, pero, según declaraciones recogidas por medios estadounidenses, no confirman ni desmienten el uso de técnicas para saltarse los mecanismos de no rastreo.
Desde la compañía señalan, según informes, que procuran respetar las políticas de los sitios y brindar un servicio eficiente a sus usuarios. Sin embargo, la ambigüedad alimenta el debate sobre la transparencia y la ética en el entrenamiento de modelos de IA usando datos públicos.
El caso reabre la discusión sobre cómo los grandes modelos de lenguaje obtienen la información con la que responden a millones de preguntas. Algunos expertos recuerdan que el respeto a los protocolos estándar de la web, como el robots.txt, es fundamental para mantener el equilibrio entre innovación y derecho a la privacidad.
Para administradores de sitios web, este escenario plantea la necesidad de nuevas herramientas de control y monitorización, especialmente ante la proliferación de proyectos de inteligencia artificial que recorren la red en busca de contenido.
Impactos en la confianza y recomendaciones para los sitios web
Según Cloudflare, la confianza en la web depende en gran medida del respeto a los acuerdos técnicos entre agentes automáticos y administradores.
Romper estas normas supone un riesgo para la sostenibilidad del ecosistema digital, donde los propietarios de webs pueden decidir restringir el acceso a nuevas tecnologías y modelos de IA.
De momento, la compañía recomienda a los administradores de sitios web que monitoricen el tráfico en busca de comportamientos anómalos y revisen los mecanismos disponibles para bloquear robots no deseados.
También sugieren el uso de soluciones avanzadas de filtrado, como sus propios servicios, para proteger los contenidos sensibles o regulados.
Mientras el debate se intensifica, la comunidad técnica propone revisar los protocolos y mecanismos de identificación de crawlers para adaptarlos a los desafíos actuales. No solo se trata de salvaguardar la privacidad, sino de asegurar la confianza de los usuarios en una internet abierta y sostenible.
Un desafío abierto para el futuro de la inteligencia artificial en la web
El enfrentamiento entre Cloudflare y Perplexity es solo una muestra de las tensiones crecientes en torno al uso de datos públicos en inteligencia artificial. Según expertos consultados, la evolución de este sector exige un diálogo abierto y normas claras sobre cómo y para qué se puede recopilar información online.
Para quienes trabajan en el desarrollo web o la protección de datos, este caso evidencia la importancia de actualizar políticas de rastreo y formarse constantemente en las nuevas formas de acceso automatizado.
Si te interesa saber más sobre la relación entre inteligencia artificial y privacidad web, puedes consultar nuestro especial sobre IA y ética digital o revisar recursos externos sobre gestión de bots en la web.