Hace un año, Cloudflare declaró el primer Día de la Independencia de Contenido, ofreciendo a los propietarios de sitios web herramientas para reclamar control sobre su contenido.
El acuerdo de treinta años entre crawlers y propietarios (crawl en intercambio de referencia) había sido roto por la inteligencia artificial, que consumía contenido sin devolver valor alguno. La respuesta inicial fue un botón simple de bloquear todos los bots de IA, seguido por un marketplace de pago por crawl.
Hoy, 1 de julio de 2026, Cloudflare anuncia la segunda fase con algo que debería haber existido desde el principio, con controles granulares que permiten decidir exactamente cómo se usa tu contenido.
No se trata ya de bloquear o permitir indiscriminadamente, sino de clasificar el comportamiento de los bots y establecer reglas específicas según lo que hagan con tu información. Este cambio representa un punto de inflexión real en la relación entre propietarios de contenido y sistemas de inteligencia artificial.
El problema que nadie quería discutir abiertamente
Durante demasiado tiempo, la industria ha evitado nombrar el conflicto central: los modelos de lenguaje generativo se entrenan con contenido creado por humanos sin compensación alguna.
Un artículo que puede requerir días de investigación, redacción y edición es absorbido por un modelo que luego genera respuestas similares sin mencionar la fuente original.
El tráfico de referencia que sostenía el modelo económico del contenido online ha desaparecido, sustituido por respuestas generadas que canalizan usuarios hacia plataformas cerradas.
La estrategia inicial de muchos propietarios fue binaria: bloquear completamente cualquier bot identificado como de inteligencia artificial.
El problema es que esta aproximación castiga indiferentemente a BingBot que busca indexar contenido para resultados de búsqueda tradicionales, y a un crawler de ChatGPT que almacena el contenido permanentemente para entrenamiento de modelos. Ambos son técnicamente bots de IA pero con impactos radicalmente diferentes para el propietario del sitio.
Cloudflare ha reconocido públicamente que la aproximación de bloqueo total perjudica la descubribilidad y crea un dinámico injusto que favorece a los buscadores establecidos mientras incentiva a nuevos participantes a ser evasivos sobre su identidad real.
La solución propuesta abandona la distinción simplista entre IA y no IA para centrarse en algo mucho más significativo y es qué está haciendo exactamente el bot con tu contenido.
La nueva taxonomía de tres categorías que cambia todo
La categoría Search abarca crawlers que recopilan o indexan contenido para responder preguntas posteriormente. Estos son los motores de búsqueda tradicionales como Google, Bing, Yandex y los nuevos buscadores de IA que construyen bases de datos de información.
OPERAN con el contrato implícito de Drive tráfico de vuelta al sitio original a través de enlaces en resultados de búsqueda. Estos bots deberían proporcionar compensación mediante referencia de tráfico o pago directo.
La categoría Agent incluye comportamientos automatizados que actúan en tiempo real en nombre de un humano. Estos son los agentes browser de ChatGPT, Gemini y similares que visitan aplicaciones web para completar tareas específicas solicitadas por usuarios.
Un agente puede pedirte que compares precios en tres tiendas online diferentes, o que extraigas información concreta de un artículo. Estos bots visitan tu sitio por encargo de un usuario, pero no necesariamente devuelven tráfico orgánico sostenido.
La categoría Training representa el uso más problemático desde la perspectiva del propietario de contenido. Son crawlers que exploran sitios para absorber permanentemente contenido dentro de la arquitectura del modelo para entrenamiento o fine-tuning.
El contenido se convierte en parte del conocimiento del modelo y puede ser reproducido sin atribución años después del crawl original. Este uso no genera tráfico de referencia, no compensa al creador original y potencialmente compite directamente con el sitio fuente.
Cloudflare recomienda explícitamente que los operadores de bots con múltiples funciones separen sus crawlers en identidades distintas para transparencia total. Un bot que hace Search y Training debería manifestarse como dos crawlers diferentes con User-Agents distintos, permitiendo al propietario elegir exactamente qué permite y qué bloquea.
Controles granulares disponibles para todos los clientes
La announcement más significativa es que estos controles finos están disponibles para todos los clientes de Cloudflare, incluyendo el nivel Gratuito. No se trata de una feature premium reservada para empresas que pueden pagar miles de euros mensuales. Cualquier sitio web protegido por Cloudflare puede configurar reglas específicas por categoría de bot inmediatamente.
Puedes permitir bots de Search que indexan tu contenido para aparecer en resultados tradicionales mientras bloqueas bots de Training que absorberían tu contenido para entrenar modelos competitivos.
Puedes permitir Agents que visitan páginas específicas por encargo de usuarios mientras restringes Training masivo. Esta granularidad era imposible hasta ahora, donde solo tenías la opción binaria de permitir todo o bloquear todo.
La implementación es sencilla a través del dashboard de Cloudflare en la sección Security, donde aparecen nuevas opciones configurables. No necesitas modificar robots.txt manualmente ni implementar reglas complejas en el servidor. La interfaz gráfica permite activar o desactivar cada categoría con un clic y las reglas se aplican automáticamente a todo el tráfico entrante.
Nuevos valores por defecto para 2026
Cloudflare no solo da opciones, sino que establece valores por defecto razonables que entran en vigor el 15 de septiembre de 2026 para nuevos dominios. Esta decisión elimina la necesidad de que cada propietario configure manualmente desde cero y protege por defecto a sitios que no conocen estas opciones.
En sitios que muestran publicidad, los bots de Training y Agent estarán bloqueados por defecto, mientras que los bots de Search permanecerán permitidos. La racional es clara. Publicidad. Señala un objetivo de atención humana y monetización directa. Los bots de Training y Agent pueden desviar esta atención sin compensación, mientras que los bots de Search devuelven tráfico orgánico naturalmente hacia tu sitio.
Para crawlers multipropósito que realizan múltiples funciones simultáneamente, aplica la regla más restrictiva. Si un usuario bloquea Training, crawlers como Googlebot, Applebot y BingBot serán bloqueados completamente, aunque también realicen funciones de Search.
Esta aproximación es controversial, pero lógica. Si un bot combina funciones deseables con funciones no deseadas, el propietario elige la función menos deseable y la regla se aplica al bot completo.
Los clientes existentes pueden optar por estos valores por defecto en la sección de seguridad antes del quince de septiembre. Si no realizas configuración activa, Cloudflare mantendrá tu configuración actual sin cambios automáticos. Esto da tiempo suficiente para evaluar impacto y tomar decisiones informadas sobre qué enfoque adopta tu sitio.
Definiendo cómo se usa tu contenido
Cloudflare amplía los Content Signals existentes con un nuevo atributo use que define niveles de retención de contenido. Esta señal puede establecerse a valores específicos que comunican exactamente cómo se permite almacenar y reutilizar tu información.
El valor inmediato permite interactuar con el contenido, pero prohíbe almacenar cualquier cosa para reutilización posterior. El crawler puede ver y procesar la página en tiempo real, pero no debe guardar copias ni extractos. Esto es apropiado para bots de verificación o monitoreo que necesitan acceso temporal, pero no almacenamiento permanente.
El valor de referencia es el predeterminado y permite indexar, extraer fragmentos y crear enlaces de retorno. Este es el comportamiento estándar de motores de búsqueda tradicionales, donde se muestra un snippet del contenido junto con el enlace al original. El propietario solicita tráfico de referencia a cambio de visibilidad en resultados.
El valor full permite resumir y reproducir contenido completo. Este nivel permite a un bot absorber sustancialmente tu contenido para generar respuestas que pueden reemplazar la necesidad de visitar el sitio original.
Cloudflare establece explícitamente que bots que reproducen contenido completamente no pueden obtener condición Verified independientemente de quién los opere.
Estas señales se añaden a tu archivo robots.txt, extendiendo el estándar existente. Un ejemplo práctico muestra la transición de la señal antigua Content-Signal: search=yes, ai-train=no a la nueva formato que incluye use=reference, definiendo explícitamente nivel de retención permitida. Los crawlers que respetan estas señales; los que violan perderán su estado Verified.
El directorio transparente de todos los bots conocidos
Para clientes Enterprise, Cloudflare introduce BotBase un directorio searchable de todos los bots y agentes conocidos integrado en el dashboard de Bot Management. Esta herramienta elimina la opacidad que ha caracterizado la industria, permitiendo ver exactamente qué bots existen y cómo se comportan.
BotBase proporciona una vista searchable del directorio completo de bots, clasificándolos por comportamiento en categorías como Search, Agent, Training, Transact, Data Collection, Security Testing, SEO, Ads Verification, Social/Link Preview, Feed Fetching y Monitoring & Operations.
Las tres primeras categorías son las nuevas opciones configurables disponibles para todos los clientes, mientras que el resto son clasificaciones existentes para monitoreo.
Puedes filtrar por bot específico y copiar IDs de detección para crear reglas de seguridad personalizadas. Si identificas un patrón de comportamiento problemático, puedes crear reglas específicas basadas en el ID del bot en lugar de depender de User-Agent que pueden ser falsificados fácilmente. Esta aproximación técnica aumenta significativamente la precisión de bloqueo de allowlists y reduce falsos positivos.
¿Qué significa realmente que un bot sea Verified?
La definición de bot Verified se actualiza fundamentalmente. Anteriormente, todos los bots Verified eran permitidos por defecto sin cuestionamientos. Ahora los bots Verified no están automáticamente permitidos, sino que son permitibles dentro de su categoría relevante. Un bot Verified de Search está permitido solo si el usuario permite Search en su configuración.
La verificación ahora requiere demostrar representación honesta de identidad y ausencia de abuso de acceso. Un bot que se autoidentifica como Googlebot debe realmente ser operado por Google y no puede usar esa identidad para acceder a contenido con propósitos no declarados. Los bots que intentan pasar por otros están descalificados automáticamente de verificación.
Los bots no Verified permanecen bloqueados por defecto, como ocurría anteriormente. La diferencia crítica es que ser Verified ya no garantiza acceso automático, sino simplemente que el bot representa honestamente su identidad y comportamiento. El propietario del sitio mantiene control completo sobre qué categorías permite, independientemente del estado de verificación.
Trust transitive como experimento técnico
Cloudflare propone experimentar con confianza transitiva usando el encabezado Forwarded de RFC 7239 para gestionar cadenas de confianza. Esta aproximación técnica podría resolver problemas complejos de delegación de confianza cuando múltiples intermediarios procesan peticiones.
El formato Forwarded: for equals openai permite propagar la confianza a través de intermediarios múltiples. Si un propietario de sitio confía en una plataforma específica, esa preferencia se mantiene incluso si la petición pasa por varias capas de proxies confiables. La confianza se transmite transitivamente, preservando la intención original del propietario.
Con información de uso, el formato se amplía a Forwarded: for equals openai; use equals reference, comunicando tanto la identidad del operador como el nivel de uso permitido. Esto permite escenarios donde aceptas que OpenAI acceda a tu contenido solo con restricciones de uso reference pero no full reproducción. La transmisión mantiene ambas constraints a través de toda la cadena de procesamiento.
Análisis crítico: ¿Por qué esto cambia el juego?
Lo que Cloudflare ha logrado con estos anuncios es proporcionar el primer marco operativo real para que propietarios de contenido negocien términos con operadores de IA. Durante demasiado tiempo, la relación fue unilateral, donde las grandes tecnológicas decidían usos sin consulta ni compensación. Ahora los propietarios pueden establecer condiciones explícitas que los bots verificados deben respetar para mantener acceso.
La separación en tres categorías ataca directamente el problema central que ha sido imposible de resolver hasta ahora. Puedes permitir búsquedas tradicionales que devuelven tráfico mientras bloqueas training que absorbe contenido sin compensación.
Esta granularidad era técnicamente posible teóricamente, pero no existían herramientas prácticas para implementarla hasta Cloudflare BotBase y los nuevos controles.
Los nuevos valores por defecto que bloquean Training y Agents en páginas con publicidad establecen un estándar ético importante. Reconocen implícitamente que el contenido monetizado con publicidad tiene el objetivo de atención humana y que los bots que desvían esa atención sin compensación violan el contrato implícito. Esto crea presión para que operadores de IA desarrollen mecanismos de compensación justa o pierdan acceso a contenido premium.
Las Content Signals actualizadas con atributo use proporcionan un lenguaje estandarizado para comunicación de preferencias que cualquier ratón puede implementar y respetar. No es propiedad intelectual de Cloudflare, sino extensión de estándares abiertos que cualquier plataforma puede adoptar. Esto democratiza la capacidad de controlar el uso de contenido independientemente de qué CDN o servicio uses.
Implicaciones prácticas para SEO y GEO
Para SEO tradicional, las implicaciones son mayormente positivas. Puedes continuar permitiendo Googlebot, BingBot y otros crawlers de Search que mejoran visibilidad en resultados orgánicos sin cambiar tu estrategia actual. Los valores por defecto permiten Search, lo que mantiene el status quo de indexación para sitios que no modifican configuración.
Para optimización GEO, las implicaciones son más complejas. Si bloqueas bots de Training también limitas potencialmente la citación en respuestas generativas porque muchos modelos de IA usan crawl de entrenamiento para construir conocimiento.
Sin embargo, puedes experimentar permitiendo Training solo a bots Verified específicos mientras bloqueas otros menos transparentes. Esta granularidad permite pruebas controladas de impacto en citación versus compensación.
La estrategia óptima depende de tu modelo de negocio. Sitios monetizados con publicidad pueden beneficiarse bloqueando Training por defecto mientras mantienen Search.
Sitios que priorizan citación en IA pueden necesitar permitir Training selectivamente a cambio de visibilidad en correspondencias generadas. No hay solución universal, sino decisiones estratégicas basadas en objetivos específicos.
Lo fundamental es que ahora tienes control real para tomar estas decisiones. La opacidad que caracterizó la relación entre propietarios de contenido y operadores de IA está terminando. Los próximos meses verán emerger patrones claros sobre qué enfoques funcionan mejor para diferentes tipos de sitios y modelos de negocio.
Preguntas frecuentes
¿Debo bloquear todos los bots de entrenamiento inmediatamente?
No necesariamente. Depende de tu modelo de negocio y prioridades. Si monetizas con publicidad y priorizas tráfico orgánico tradicional, bloquear Training por definitivo tiene sentido. Si buscas visibilidad en respuestas generativas de IA, puede necesitar permitir Training selectivamente a bots verificados mientras monitoreas impacto en tráfico y compensación recibida.
¿Los valores por defecto de Cloudflare se aplican automáticamente a sitios existentes?
No. Los nuevos valores por defecto que bloquean Training y Agents se aplican solo a nuevos dominios a partir del quince de septiembre de 2026. Sitios existentes mantienen su configuración actual sin cambios automáticos. Tenemos tiempo hasta esa fecha para evaluar opciones y optar activamente por los nuevos defaults si queremos.
¿Qué pasa con Googlebot si bloqueo Training?
Googlebot realiza múltiples funciones, incluyendo Search y Training. Según la política de Cloudflare, si bloqueas Training, crawlers multipropósito como Googlebot serán bloqueados completamente, incluso si también realizan Search. Esto es controversial porque afecta la indexación tradicional, pero sigue una lógica consistente y es que el comportamiento menos deseable determina la regla aplicable al bot completo.
¿Necesito Cloudflare Enterprise para usar estos controles?
No. Los controles fundamentales de clasificación Search, Agent y Training están disponibles para todos los niveles, incluyendo gratuito. BotBase con directorio completo de bots y capacidades avanzadas de filtrado es exclusivo para clientes Enterprise. Las funcionalidades básicas de control de tráfico de IA están democratizadas para cualquier sitio protegido por Cloudflare.
¿Cómo afecta esto a mi estrategia de optimización para motores generativos?
Tu estrategia puede evolucionar de intento de citación universal a negociación selectiva. Puedes permitir Training solo a modelos específicos que ofrecen compensación directa o beneficios claros, mientras bloqueas otros menos transparentes. La granularidad permite experimentación controlada, midiendo impacto de citación versus compensación recibida, ajustando estrategia según resultados.
¿Qué hacer si un bot Verified viola mis señales Content-Signal?
Reportar el abuso a Cloudflare que revocará el estado Verified del bot incumplidor. Los bots Verified que violan señales establecidas pierden automáticamente su condición de verificación y pasan a ser tratados como bots no Verified bloqueados por defecto. Este mecanismo de enforcement garantiza que la verificación mantiene credibilidad y confianza en el sistema.
