Cloudflare puede estar dejándote fuera de Google y de ChatGPT
Desde septiembre de 2026, bloquear el entrenamiento de IA en Cloudflare también bloquea a Googlebot. Qué cambió, qué bot es cada uno y qué revisar en tu panel.
Si alguien activó Cloudflare en tu web hace tiempo y nadie ha vuelto a entrar en el panel, este cambio te afecta: un ajuste pensado para «proteger tu contenido de las IA» puede dejarte fuera de los buscadores sin que te des cuenta.
Qué cambió en 2026
El 1 de julio de 2026, Cloudflare cambió su interruptor único para bots de IA por tres comportamientos que se controlan por separado: Search (rastreadores que indexan para responder después), Agent (herramientas que visitan tu web en nombre de una persona) y Training (rastreadores que entrenan modelos) (Cloudflare).
El 15 de septiembre de 2026 llegó el cambio delicado. Googlebot, Bingbot y Applebot sirven a la vez para la búsqueda y para el entrenamiento: son rastreadores «mixtos». Desde esa fecha, Block y Block on pages with ads se aplican también a ellos, así que afectan a la búsqueda además de al entrenamiento. Para frenar el entrenamiento sin perder la búsqueda, Cloudflare propone una opción nueva, Disallow AI Training (Cloudflare).
- 01
Training en «Block»
Pensado para que las IA no entrenen con tu web.
- 02
Afecta a los mixtos
Googlebot, Bingbot y Applebot también se bloquean.
- 03
Fuera de buscadores
Sin Googlebot no hay Google, ni sus AI Overviews.
La trampa de Google-Extended
Hay otra forma de quedarse fuera sin querer. Si activas el robots.txt gestionado de Cloudflare, añade al principio de tu archivo un bloque como este (Cloudflare):
# BEGIN Cloudflare Managed content
User-Agent: *
Content-signal: search=yes, ai-train=no, use=reference
Allow: /
User-agent: Google-Extended
Disallow: /
User-agent: GPTBot
Disallow: /
# … y otros rastreadores de entrenamiento
# END Cloudflare Managed Content
Parece inofensivo, pero el Disallow a Google-Extended no solo frena el entrenamiento de Gemini. Google explica que ese mismo token controla si tu contenido se usa para dar contexto a las respuestas de la app Gemini; lo que no toca es tu inclusión en la búsqueda de Google (Google). Resultado: sigues en Google, pero es más difícil que Gemini te recomiende.
Qué bot es cada uno
No todos los bots de IA hacen lo mismo. Bloquear uno de búsqueda te saca de las respuestas; bloquear uno de entrenamiento, no. Estos son los principales, con lo que dice cada empresa:
| Bot | De quién | Para qué sirve | Si lo bloqueas |
|---|---|---|---|
| Googlebot | La búsqueda de Google, que también alimenta los AI Overviews y el modo IA | Desapareces de Google | |
| Google-Extended | Entrenar Gemini y dar contexto a las respuestas de la app Gemini | Sigues en Google; pierdes la app Gemini | |
| OAI-SearchBot | OpenAI | Mostrar webs en las respuestas con búsqueda de ChatGPT | No sales en esas respuestas |
| GPTBot | OpenAI | Rastrear contenido que puede usarse para entrenar sus modelos | Tu contenido no se usa para entrenar |
| Claude-SearchBot | Anthropic | Mejorar la calidad de los resultados de búsqueda de Claude | Puede bajar tu visibilidad en Claude |
| ClaudeBot | Anthropic | Recoger contenido que puede servir para entrenar sus modelos | Tu contenido no se usa para entrenar |
| PerplexityBot | Perplexity | Mostrar y enlazar webs en los resultados de Perplexity; no entrena modelos | No sales en Perplexity |
Fuentes: Google, OpenAI, Anthropic y Perplexity.
Bloquear el entrenamiento es una decisión legítima de cada negocio. Lo importante es saber qué estás eligiendo. En citaproof.com dejamos entrar a todos, también a los de entrenamiento: queremos que las IA sepan quiénes somos.
Qué revisar en tu panel de Cloudflare
Diez minutos y una lista. Si no tienes acceso al panel, pásasela a quien te lleve la web.
Cloudflare sin sorpresas
- Por revisar: Políticas de bots de IA: Search en Allow y Agent en Allow. Training en Allow o en Disallow AI Training, pero nunca en Block si quieres seguir en Google.
- Por revisar: Robots.txt gestionado y Bot Preference Sync: decide si los quieres. Si están activos, mira qué escriben en tu
robots.txt. - Por revisar: AI Crawl Control: revisa la lista de rastreadores y que ninguno de búsqueda esté bloqueado.
- Por revisar: Reglas del WAF: que ninguna regla antigua bloquee bots por su nombre.
- Por revisar: Comprueba el resultado: abre
tudominio.es/robots.txty lee lo que ve un bot de verdad.
Y una última comprobación: en Search Console, el informe de indexación de páginas enseña las que Google no ha podido indexar y por qué. Si tras cambiar algo en Cloudflare ves páginas que caen de golpe, empieza por aquí.
Fuentes
- 01Mixed-use AI crawlers: Disallow AI TrainingBlog de Cloudflare · 15 de septiembre de 2026
- 02New AI traffic options: Search, Agent and TrainingChangelog de Cloudflare · 1 de julio de 2026
- 03Managed robots.txtDocumentación de Cloudflare · consultada el 11/10/2026
- 04Google's common crawlersGoogle Search Central · consultada el 11/10/2026
- 05Overview of OpenAI crawlersOpenAI · consultada el 11/10/2026
- 06Does Anthropic crawl data from the web, and how can site owners block the crawler?Centro de ayuda de Claude · consultada el 11/10/2026
- 07Perplexity crawlersDocumentación de Perplexity · consultada el 11/10/2026