Bloquear bots de IA en Cloudflare sin desaparecer de ChatGPT ni de Google
Publicado el 07-10-202610 min de lecturaPor la redacción de SmoothSeen
Para bloquear los bots de IA en Cloudflare sin perder visibilidad, entra en Security Settings, pon Training en «Disallow AI Training», deja Search en «Allow» y decide Agent aparte. No elijas «Block» para Training: desde el 15-09-2026 ese ajuste bloquea también a Googlebot, Bingbot y Applebot. Bloquear Search te saca de ChatGPT, Claude y Perplexity.
Lo esencial
- Cloudflare clasifica los bots de IA en tres comportamientos (Search, Agent y Training) y deja bloquear cada uno por separado, también en el plan gratuito, desde el 01-07-2026.
- Desde el 15-09-2026, poner Training en «Block» bloquea también a Googlebot, Bingbot y Applebot, porque rastrean a la vez para buscar y para entrenar. Para frenar solo el entrenamiento existe «Disallow AI Training».
- OAI-SearchBot, Claude-SearchBot y PerplexityBot son rastreadores de búsqueda: si los bloqueas, ChatGPT, Claude y Perplexity dejan de poder citarte. GPTBot, ClaudeBot o CCBot son de entrenamiento y vetarlos no te saca de sus respuestas.
- robots.txt expresa una preferencia; el cortafuegos de Cloudflare responde 403. Un bloqueo en el cortafuegos no se ve en robots.txt.
Para comprobarlo en tu web: Auditoría de visibilidad en IA
En esta página
- ¿Qué controla Cloudflare y qué no?
- Search, Agent y Training: los tres comportamientos
- Qué cambió el 15 de septiembre de 2026
- Tabla de decisión: qué quieres y qué ajuste elegir
- AI Crawl Control: permitir o bloquear rastreador por rastreador
- Una regla de WAF que deja pasar la búsqueda y para el entrenamiento
- robots.txt, Content Signals y Bot Preference Sync
- Cómo comprobarlo
- Qué hace SmoothSeen con esto
- Qué hacer esta semana
- Preguntas frecuentes
Cloudflare es un proxy inverso: todo el tráfico de tu web pasa por su red antes de llegar a tu servidor, así que puede responder con un 403 a un rastreador sin que tu servidor se entere. Eso lo hace muy útil para frenar el entrenamiento de modelos con tu contenido y muy peligroso si marcas la casilla equivocada. Esta guía explica qué hace cada ajuste según la documentación y el blog oficial de Cloudflare a 07-10-2026, porque cambiaron dos veces en tres meses.
¿Qué controla Cloudflare y qué no?
Cloudflare actúa en dos capas distintas, la preferencia y el bloqueo, y conviene no confundirlas:
- Capa
- robots.txt (gestionado por Cloudflare o el tuyo)
- Qué hace
- Publica una preferencia: «no entrenes con esto»
- Quién la respeta
- Solo los rastreadores que deciden cumplirla
- Capa
- Ajustes de bots de IA y AI Crawl Control
- Qué hace
- Bloquean la petición en la red de Cloudflare con un 403
- Quién la respeta
- Todos los que Cloudflare identifica
- Capa
- Reglas personalizadas del WAF
- Qué hace
- Bloquean, desafían u omiten según la expresión que escribas
- Quién la respeta
- Todos los que cumplen la expresión
La propia Cloudflare lo dice en su documentación: cumplir robots.txt es voluntario y el fichero no impide técnicamente el acceso1. El cortafuegos sí. La consecuencia que más se olvida: un bloqueo en el cortafuegos no aparece en robots.txt. Puedes tener un robots.txt que permite a OAI-SearchBot y un 403 en Cloudflare que lo echa.
Lo que Cloudflare no controla: si un asistente te cita o no. Eso depende del contenido de la página. Cloudflare solo decide quién entra. Si tu web no pasa por Cloudflare, el mismo veto por user-agent se hace en el servidor, en Apache con .htaccess o en Nginx. El resto de la configuración de Cloudflare (HTTPS, HSTS, cabeceras y caché) está en la guía de cabeceras de seguridad y caché en Cloudflare.
Search, Agent y Training: los tres comportamientos
Desde el 01-07-2026, Cloudflare deja gestionar a todos sus clientes, también los del plan gratuito, tres comportamientos de IA por separado2:
- Search: rastreadores que recogen o indexan tu contenido para responder preguntas después.
- Agent: actividad automática que actúa en tiempo real en nombre de una persona, como los bots que abren una página cuando alguien la pide en un chat.
- Training: rastreadores que toman tu contenido para entrenar o ajustar un modelo.
Cada uno admite «Block» en todas las páginas, «Block on pages with ads» (solo en las páginas donde Cloudflare detecta anuncios) o «Allow»2. Un mismo bot puede tener varios comportamientos3. Así clasifica Cloudflare los rastreadores más comunes en su referencia, comparado con lo que dice el dueño de cada uno:
- Rastreador
- OAI-SearchBot
- Categoría en Cloudflare
- AI Search
- Para qué sirve, según su dueño
- Búsqueda de ChatGPT: si lo vetas, no sales en sus respuestas4
- Rastreador
- Claude-SearchBot
- Categoría en Cloudflare
- AI Search
- Para qué sirve, según su dueño
- Índice de búsqueda de Claude5
- Rastreador
- PerplexityBot
- Categoría en Cloudflare
- AI Search
- Para qué sirve, según su dueño
- Enlazar webs en los resultados de Perplexity6
- Rastreador
- ChatGPT-User, Claude-User, Perplexity-User
- Categoría en Cloudflare
- AI Assistant
- Para qué sirve, según su dueño
- Abrir una página cuando un usuario la pide
- Rastreador
- GPTBot, ClaudeBot, meta-externalagent
- Categoría en Cloudflare
- AI Crawler
- Para qué sirve, según su dueño
- Entrenamiento de modelos (Cloudflare pone en la misma categoría a CCBot y Bytespider)
- Rastreador
- Googlebot, Bingbot
- Categoría en Cloudflare
- Search Engine
- Para qué sirve, según su dueño
- Buscador clásico; Cloudflare los trata como mixtos (búsqueda y entrenamiento)
Las categorías de la segunda columna son las de la referencia de bots de Cloudflare7. Dos detalles importan. Bloquear Agent impide que ChatGPT, Claude o Perplexity abran tu página cuando un usuario la pide en la conversación, y OpenAI y Perplexity avisan de que esos agentes pueden no seguir robots.txt46. Y Google-Extended no aparece en ninguna tabla de bloqueo porque no es un rastreador: es una marca de robots.txt que no tiene user-agent propio8. Solo se controla desde robots.txt.
Qué cambió el 15 de septiembre de 2026
Un poco de historia: el 01-07-2025, Cloudflare anunció que pasaba a bloquear por defecto los rastreadores de IA que no pagaran por el contenido9. Un año después cambió de enfoque y separó los tres comportamientos. El problema pendiente era otro: Google, Microsoft y Apple usan un solo rastreador para buscar y para entrenar. Hasta septiembre, el bloqueo de Training de Cloudflare no los tocaba. Desde el 15-09-2026 sí10:
- «Block» y «Block on pages with ads» en Training se aplican también a los rastreadores mixtos, incluidos Googlebot, Bingbot y Applebot. Elegir «Block» los para del todo, búsqueda incluida.
- Nace «Disallow AI Training»: publica la preferencia de no entrenar en robots.txt, deja pasar a los rastreadores mixtos que Cloudflare considera «Accountable» (Googlebot, Bingbot y Applebot) y bloquea al resto de rastreadores de entrenamiento, incluidos los de solo entrenamiento de Amazon, Anthropic, Meta y OpenAI.
- El antiguo interruptor «Block AI bots» se retira en favor de los tres controles, y el robots.txt gestionado deja paso a Bot Preference Sync, que escribe en robots.txt lo que configuras en el panel11.
- Los dominios nuevos eligen entre dos configuraciones recomendadas: si la web no vive de anuncios, todo en «Allow»; si vive de anuncios, Training en «Disallow AI Training» y Agent bloqueado en las páginas con anuncios.
Según Cloudflare, sus clientes que tenían ajustes antiguos se migran solos y no tienen que hacer nada10. Aun así, entra a comprobar qué ha quedado. Un matiz para Bing: Microsoft todavía no lee la preferencia de no entrenar en robots.txt (lo prevé para principios de 2027), así que «Disallow AI Training» no le transmite esa preferencia por ahora10.
Un dato para decidir: según Cloudflare, menos del 1 % de sus sitios bloquea Search y el 17 % usa algún mecanismo para bloquear el entrenamiento (septiembre de 2026)10.
Tabla de decisión: qué quieres y qué ajuste elegir
- Lo que quieres
- Que te citen ChatGPT, Claude, Perplexity y Google, y que no entrenen con tu web
- Search
- Allow
- Training
- Disallow AI Training
- Agent
- Allow
- Lo que quieres
- Lo mismo, y además que los agentes no consuman tus páginas con anuncios
- Search
- Allow
- Training
- Disallow AI Training
- Agent
- Block on pages with ads
- Lo que quieres
- Máxima visibilidad, sin restricciones
- Search
- Allow
- Training
- Allow
- Agent
- Allow
- Lo que quieres
- Salir de todos los buscadores, Google incluido
- Search
- Block
- Training
- Block
- Agent
- Block
La fila que casi nadie quiere es la última, y es la que se activa por error si eliges «Block» pensando en la IA. El ajuste está en el panel de la zona, en Security Settings10. Si tu web tiene un único objetivo de negocio (que te encuentren), la primera fila es la razonable: el entrenamiento se frena y la visibilidad queda intacta.
AI Crawl Control: permitir o bloquear rastreador por rastreador
AI Crawl Control (antes AI Audit) es el panel de Cloudflare para ver qué rastreadores de IA visitan tu web y decidir uno por uno12. Está en el menú de la zona, en AI Crawl Control, pestaña Crawlers, columna Action: «Allow» o «Block». Tres cosas que conviene saber de la documentación1213:
- En el plan gratuito identifica los rastreadores por su user-agent; la detección más fina, con los identificadores de Bot Management, es de Enterprise.
- Al bloquear, crea o actualiza una única regla personalizada del WAF llamada «AI Crawl Control». En los planes de pago puedes elegir que responda 403 o 402.
- Si un rastreador marcado como «Allow» sigue bloqueado, busca una regla del WAF anterior que lo esté parando: la regla de AI Crawl Control solo contiene los bloqueados.
La tercera opción, cobrar por rastreo (Pay per crawl), sigue en beta privada a 07-10-202612.
Una regla de WAF que deja pasar la búsqueda y para el entrenamiento
Si quieres más control que los tres ajustes (por ejemplo, frenar el entrenamiento solo en /blog/), usa reglas personalizadas en Security rules > Create rule > Custom rules14. Estas dos expresiones usan campos que existen en la referencia de Cloudflare: cf.client.bot (bot verificado) y cf.verified_bot_category (su categoría)3.
Primera regla, acción Skip (omitir las demás reglas personalizadas), colocada la primera:
(cf.client.bot and cf.verified_bot_category in {"Search Engine Crawler" "AI Search"})Segunda regla, acción Block:
(cf.client.bot and cf.verified_bot_category eq "AI Crawler")
or (http.user_agent contains "GPTBot")
or (http.user_agent contains "ClaudeBot")
or (http.user_agent contains "CCBot")
or (http.user_agent contains "Bytespider")
or (http.user_agent contains "meta-externalagent")Por qué está escrita así:
- La categoría «AI Crawler» no incluye a Googlebot (es «Search Engine Crawler») ni a OAI-SearchBot (es «AI Search»), así que esta regla no toca la búsqueda7.
- Las líneas de user-agent cubren a quien no esté verificado.
containsdistingue mayúsculas y «ClaudeBot» no es parte de «Claude-SearchBot», así que no se lo lleva por delante. - Las categorías antiguas siguen funcionando en las reglas del WAF, según Cloudflare, aunque su clasificación nueva use Search, Agent y Training3.
El plan gratuito admite cinco reglas personalizadas, y AI Crawl Control ocupa una si bloqueas algo con él13. Un aviso: bloquear por user-agent no protege de quien lo falsifica. Un scraper que se presenta como Chrome pasa por la segunda regla sin tocarla.
robots.txt, Content Signals y Bot Preference Sync
Las Content Signals son tres preferencias que Cloudflare escribe en robots.txt: search (índice de búsqueda y resultados con enlaces), ai-input (usar el contenido como entrada de un modelo para responder, por ejemplo con RAG) y ai-train (entrenar o ajustar modelos)1. El robots.txt gestionado por Cloudflare añade antes de tu propio fichero esta línea:
User-Agent: *
Content-signal: search=yes, ai-train=no, use=reference
Allow: /Y debajo, un Disallow: / para Amazonbot, Applebot-Extended, Bytespider, CCBot, ClaudeBot, Google-Extended, GPTBot y meta-externalagent1. Ninguno de ellos es un rastreador de búsqueda. Fíjate en que no declara nada sobre ai-input: la respuesta en tiempo real de un asistente queda sin preferencia.
Dos avisos de la documentación: Search Console puede marcar esas líneas como «Syntax not understood», y Cloudflare dice no haber visto efecto en el rastreo ni en el SEO1. Y desde septiembre, el robots.txt gestionado se sustituye por Bot Preference Sync, que se activa por defecto en los clientes nuevos y antepone sus líneas a tu robots.txt sin borrar tus Disallow11. Si tienes reglas finas del WAF, Cloudflare recomienda apagar la sincronización y escribir el fichero a mano, porque no lee las reglas personalizadas11.
Cómo comprobarlo
- Mira el robots.txt servido, no el de tu servidor: abre
https://example.com/robots.txty busca el bloqueBEGIN Cloudflare. - Revisa AI Crawl Control > Metrics: muestra los códigos de respuesta por rastreador. Si OAI-SearchBot recibe 403, algo lo está bloqueando.
- Prueba con
curlpidiendo la página con el user-agent de cada bot:
curl -s -o /dev/null -w "%{http_code}\n" -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; OAI-SearchBot/1.4; +https://openai.com/searchbot" https://example.com/
curl -s -o /dev/null -w "%{http_code}\n" -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.4; +https://openai.com/gptbot" https://example.com/La prueba con curl tiene un límite que conviene entender: Cloudflare verifica a los bots por su IP, su DNS inverso o su firma, no solo por el user-agent3. Una petición desde tu ordenador con el user-agent de OAI-SearchBot no es un bot verificado. Si el bloqueo depende del user-agent (AI Crawl Control en el plan gratuito, o la segunda regla de arriba), curl lo reproduce. Si depende de la categoría de bot verificado, solo lo verás en las métricas de Cloudflare.
Qué hace SmoothSeen con esto
SmoothSeen pide tu página con el user-agent de cada rastreador de IA y la compara con lo que recibe un navegador y Googlebot: si el cortafuegos responde 403 a OAI-SearchBot o a PerplexityBot mientras sirve la página a los demás, lo señala, aunque robots.txt les deje pasar. También lee el robots.txt servido y separa los rastreadores de búsqueda de los de entrenamiento; vetar a GPTBot o a ClaudeBot no cuenta como fallo. Por lo que explica el apartado anterior, un bloqueo que solo afecta a bots verificados por IP puede no reproducirse desde fuera.
Qué hacer esta semana
Entra en Security Settings de tu zona y apunta qué tienen Search, Training y Agent. Si Training está en «Block», cámbialo a «Disallow AI Training» salvo que quieras salir también de Google. Después, comprueba desde fuera qué ve cada rastreador de IA con una auditoría de Posicionamiento IA.
Preguntas frecuentes
¿Bloquear GPTBot me saca de ChatGPT?
No. Según OpenAI, GPTBot es el rastreador de entrenamiento y la búsqueda de ChatGPT depende de OAI-SearchBot, que se controla por separado. Puedes vetar GPTBot en robots.txt o en Cloudflare y seguir apareciendo en las respuestas de ChatGPT con búsqueda, siempre que OAI-SearchBot pueda entrar y ninguna regla del cortafuegos le devuelva un 403.
¿Cloudflare bloquea los bots de IA por defecto?
Depende de cuándo y cómo diste de alta el dominio. En julio de 2025 Cloudflare anunció el bloqueo por defecto de los rastreadores de IA. Desde el 15-09-2026, los dominios nuevos eligen entre dos configuraciones: sin bloqueos si la web no vive de anuncios, o «Disallow AI Training» y agentes bloqueados en páginas con anuncios si vive de ellos. Revisa siempre Security Settings.
¿Qué diferencia hay entre «Block» y «Disallow AI Training»?
«Block» en Training deja fuera a todos los rastreadores que entrenan, incluidos los que también buscan, como Googlebot, Bingbot y Applebot. «Disallow AI Training» escribe la preferencia de no entrenar en robots.txt, deja pasar a esos tres para la búsqueda y bloquea al resto de rastreadores de entrenamiento, como GPTBot o ClaudeBot.
¿Si permito un bot en robots.txt, puede seguir bloqueado?
Sí. robots.txt y el cortafuegos son capas distintas. El rastreador lee que puede pasar, pide la página y Cloudflare le responde 403 por un ajuste de bots de IA, una regla de AI Crawl Control o una regla personalizada del WAF. Desde fuera solo se nota pidiendo la página como ese bot o mirando las métricas de AI Crawl Control.
Fuentes
- 1robots.txt setting, Cloudflare Docs, actualizada el 03-08-2026.
- 2Block AI Bots, Cloudflare Docs, actualizada el 01-07-2026.
- 3Verified bots, Cloudflare Docs, actualizada el 01-07-2026.
- 4Overview of OpenAI Crawlers, OpenAI, consultada el 07-10-2026.
- 5Does Anthropic crawl data from the web, and how can site owners block the crawler?, Anthropic, consultada el 07-10-2026.
- 6Perplexity Crawlers, Perplexity, consultada el 07-10-2026.
- 7Bot reference, Cloudflare AI Crawl Control Docs, actualizada el 23-04-2026.
- 8Google's common crawlers, Google Search Central, actualizada el 14-07-2026.
- 9Content Independence Day: no AI crawl without compensation!, Matthew Prince, blog de Cloudflare, 01-07-2025.
- 10Have it both ways: stay discoverable in search while disallowing AI training, Bryan Becker, blog de Cloudflare, 15-09-2026.
- 11Say it once: introducing Bot Preference Sync, Jin-Hee Lee, blog de Cloudflare, 21-08-2026.
- 12Manage AI crawlers, Cloudflare AI Crawl Control Docs, actualizada el 28-07-2026.
- 13AI Crawl Control with Cloudflare WAF, Cloudflare Docs, actualizada el 03-08-2026; límites por plan en Custom rules, consultada el 07-10-2026.
- 14Create a custom rule in the dashboard, Cloudflare Docs, actualizada el 03-08-2026.
Cómo citar este artículo
SmoothSeen. (2026, 7 de octubre). Bloquear bots de IA en Cloudflare sin desaparecer de ChatGPT ni de Google. https://smoothseen.com/es/blog/cloudflare-bloquear-bots-ia/
Sigue leyendo
Posicionamiento en IA: guía de AEO y GEO para que ChatGPT, Gemini y Google te citen
Qué es el posicionamiento en IA (AEO y GEO), cómo eligen fuentes ChatGPT, Gemini y Google, qué bots dejar pasar y una checklist por bloques.
AEO, GEO y SEO: qué es cada uno y en qué se diferencian (con ejemplos)
Diferencia entre AEO, GEO y SEO: qué busca cada uno, dónde aparece el resultado, qué señales pesan y cómo se mide. Con tabla y un ejemplo.
Bloquear GPTBot y otros bots de IA en robots.txt sin dejar de salir en sus respuestas
Qué rastreadores de IA usan OpenAI, Anthropic, Google, Perplexity, Apple, Meta y Amazon, cuáles vetar en robots.txt y cómo ver si tu servidor los frena.