Saltar al contenido

Bloquear bots de IA en Cloudflare sin desaparecer de ChatGPT ni de Google

Publicado el 07-10-202610 min de lecturaPor la redacción de SmoothSeen

Para bloquear los bots de IA en Cloudflare sin perder visibilidad, entra en Security Settings, pon Training en «Disallow AI Training», deja Search en «Allow» y decide Agent aparte. No elijas «Block» para Training: desde el 15-09-2026 ese ajuste bloquea también a Googlebot, Bingbot y Applebot. Bloquear Search te saca de ChatGPT, Claude y Perplexity.

Lo esencial

  • Cloudflare clasifica los bots de IA en tres comportamientos (Search, Agent y Training) y deja bloquear cada uno por separado, también en el plan gratuito, desde el 01-07-2026.
  • Desde el 15-09-2026, poner Training en «Block» bloquea también a Googlebot, Bingbot y Applebot, porque rastrean a la vez para buscar y para entrenar. Para frenar solo el entrenamiento existe «Disallow AI Training».
  • OAI-SearchBot, Claude-SearchBot y PerplexityBot son rastreadores de búsqueda: si los bloqueas, ChatGPT, Claude y Perplexity dejan de poder citarte. GPTBot, ClaudeBot o CCBot son de entrenamiento y vetarlos no te saca de sus respuestas.
  • robots.txt expresa una preferencia; el cortafuegos de Cloudflare responde 403. Un bloqueo en el cortafuegos no se ve en robots.txt.

Para comprobarlo en tu web: Auditoría de visibilidad en IA

En esta página

Cloudflare es un proxy inverso: todo el tráfico de tu web pasa por su red antes de llegar a tu servidor, así que puede responder con un 403 a un rastreador sin que tu servidor se entere. Eso lo hace muy útil para frenar el entrenamiento de modelos con tu contenido y muy peligroso si marcas la casilla equivocada. Esta guía explica qué hace cada ajuste según la documentación y el blog oficial de Cloudflare a 07-10-2026, porque cambiaron dos veces en tres meses.

¿Qué controla Cloudflare y qué no?

Cloudflare actúa en dos capas distintas, la preferencia y el bloqueo, y conviene no confundirlas:

Capa
robots.txt (gestionado por Cloudflare o el tuyo)
Qué hace
Publica una preferencia: «no entrenes con esto»
Quién la respeta
Solo los rastreadores que deciden cumplirla
Capa
Ajustes de bots de IA y AI Crawl Control
Qué hace
Bloquean la petición en la red de Cloudflare con un 403
Quién la respeta
Todos los que Cloudflare identifica
Capa
Reglas personalizadas del WAF
Qué hace
Bloquean, desafían u omiten según la expresión que escribas
Quién la respeta
Todos los que cumplen la expresión

La propia Cloudflare lo dice en su documentación: cumplir robots.txt es voluntario y el fichero no impide técnicamente el acceso1. El cortafuegos sí. La consecuencia que más se olvida: un bloqueo en el cortafuegos no aparece en robots.txt. Puedes tener un robots.txt que permite a OAI-SearchBot y un 403 en Cloudflare que lo echa.

Lo que Cloudflare no controla: si un asistente te cita o no. Eso depende del contenido de la página. Cloudflare solo decide quién entra. Si tu web no pasa por Cloudflare, el mismo veto por user-agent se hace en el servidor, en Apache con .htaccess o en Nginx. El resto de la configuración de Cloudflare (HTTPS, HSTS, cabeceras y caché) está en la guía de cabeceras de seguridad y caché en Cloudflare.

Search, Agent y Training: los tres comportamientos

Desde el 01-07-2026, Cloudflare deja gestionar a todos sus clientes, también los del plan gratuito, tres comportamientos de IA por separado2:

  • Search: rastreadores que recogen o indexan tu contenido para responder preguntas después.
  • Agent: actividad automática que actúa en tiempo real en nombre de una persona, como los bots que abren una página cuando alguien la pide en un chat.
  • Training: rastreadores que toman tu contenido para entrenar o ajustar un modelo.

Cada uno admite «Block» en todas las páginas, «Block on pages with ads» (solo en las páginas donde Cloudflare detecta anuncios) o «Allow»2. Un mismo bot puede tener varios comportamientos3. Así clasifica Cloudflare los rastreadores más comunes en su referencia, comparado con lo que dice el dueño de cada uno:

Rastreador
OAI-SearchBot
Categoría en Cloudflare
AI Search
Para qué sirve, según su dueño
Búsqueda de ChatGPT: si lo vetas, no sales en sus respuestas4
Rastreador
Claude-SearchBot
Categoría en Cloudflare
AI Search
Para qué sirve, según su dueño
Índice de búsqueda de Claude5
Rastreador
PerplexityBot
Categoría en Cloudflare
AI Search
Para qué sirve, según su dueño
Enlazar webs en los resultados de Perplexity6
Rastreador
ChatGPT-User, Claude-User, Perplexity-User
Categoría en Cloudflare
AI Assistant
Para qué sirve, según su dueño
Abrir una página cuando un usuario la pide
Rastreador
GPTBot, ClaudeBot, meta-externalagent
Categoría en Cloudflare
AI Crawler
Para qué sirve, según su dueño
Entrenamiento de modelos (Cloudflare pone en la misma categoría a CCBot y Bytespider)
Rastreador
Googlebot, Bingbot
Categoría en Cloudflare
Search Engine
Para qué sirve, según su dueño
Buscador clásico; Cloudflare los trata como mixtos (búsqueda y entrenamiento)

Las categorías de la segunda columna son las de la referencia de bots de Cloudflare7. Dos detalles importan. Bloquear Agent impide que ChatGPT, Claude o Perplexity abran tu página cuando un usuario la pide en la conversación, y OpenAI y Perplexity avisan de que esos agentes pueden no seguir robots.txt46. Y Google-Extended no aparece en ninguna tabla de bloqueo porque no es un rastreador: es una marca de robots.txt que no tiene user-agent propio8. Solo se controla desde robots.txt.

Qué cambió el 15 de septiembre de 2026

Un poco de historia: el 01-07-2025, Cloudflare anunció que pasaba a bloquear por defecto los rastreadores de IA que no pagaran por el contenido9. Un año después cambió de enfoque y separó los tres comportamientos. El problema pendiente era otro: Google, Microsoft y Apple usan un solo rastreador para buscar y para entrenar. Hasta septiembre, el bloqueo de Training de Cloudflare no los tocaba. Desde el 15-09-2026 sí10:

  1. «Block» y «Block on pages with ads» en Training se aplican también a los rastreadores mixtos, incluidos Googlebot, Bingbot y Applebot. Elegir «Block» los para del todo, búsqueda incluida.
  2. Nace «Disallow AI Training»: publica la preferencia de no entrenar en robots.txt, deja pasar a los rastreadores mixtos que Cloudflare considera «Accountable» (Googlebot, Bingbot y Applebot) y bloquea al resto de rastreadores de entrenamiento, incluidos los de solo entrenamiento de Amazon, Anthropic, Meta y OpenAI.
  3. El antiguo interruptor «Block AI bots» se retira en favor de los tres controles, y el robots.txt gestionado deja paso a Bot Preference Sync, que escribe en robots.txt lo que configuras en el panel11.
  4. Los dominios nuevos eligen entre dos configuraciones recomendadas: si la web no vive de anuncios, todo en «Allow»; si vive de anuncios, Training en «Disallow AI Training» y Agent bloqueado en las páginas con anuncios.

Según Cloudflare, sus clientes que tenían ajustes antiguos se migran solos y no tienen que hacer nada10. Aun así, entra a comprobar qué ha quedado. Un matiz para Bing: Microsoft todavía no lee la preferencia de no entrenar en robots.txt (lo prevé para principios de 2027), así que «Disallow AI Training» no le transmite esa preferencia por ahora10.

Un dato para decidir: según Cloudflare, menos del 1 % de sus sitios bloquea Search y el 17 % usa algún mecanismo para bloquear el entrenamiento (septiembre de 2026)10.

Tabla de decisión: qué quieres y qué ajuste elegir

Lo que quieres
Que te citen ChatGPT, Claude, Perplexity y Google, y que no entrenen con tu web
Search
Allow
Training
Disallow AI Training
Agent
Allow
Lo que quieres
Lo mismo, y además que los agentes no consuman tus páginas con anuncios
Search
Allow
Training
Disallow AI Training
Agent
Block on pages with ads
Lo que quieres
Máxima visibilidad, sin restricciones
Search
Allow
Training
Allow
Agent
Allow
Lo que quieres
Salir de todos los buscadores, Google incluido
Search
Block
Training
Block
Agent
Block

La fila que casi nadie quiere es la última, y es la que se activa por error si eliges «Block» pensando en la IA. El ajuste está en el panel de la zona, en Security Settings10. Si tu web tiene un único objetivo de negocio (que te encuentren), la primera fila es la razonable: el entrenamiento se frena y la visibilidad queda intacta.

AI Crawl Control: permitir o bloquear rastreador por rastreador

AI Crawl Control (antes AI Audit) es el panel de Cloudflare para ver qué rastreadores de IA visitan tu web y decidir uno por uno12. Está en el menú de la zona, en AI Crawl Control, pestaña Crawlers, columna Action: «Allow» o «Block». Tres cosas que conviene saber de la documentación1213:

  • En el plan gratuito identifica los rastreadores por su user-agent; la detección más fina, con los identificadores de Bot Management, es de Enterprise.
  • Al bloquear, crea o actualiza una única regla personalizada del WAF llamada «AI Crawl Control». En los planes de pago puedes elegir que responda 403 o 402.
  • Si un rastreador marcado como «Allow» sigue bloqueado, busca una regla del WAF anterior que lo esté parando: la regla de AI Crawl Control solo contiene los bloqueados.

La tercera opción, cobrar por rastreo (Pay per crawl), sigue en beta privada a 07-10-202612.

Una regla de WAF que deja pasar la búsqueda y para el entrenamiento

Si quieres más control que los tres ajustes (por ejemplo, frenar el entrenamiento solo en /blog/), usa reglas personalizadas en Security rules > Create rule > Custom rules14. Estas dos expresiones usan campos que existen en la referencia de Cloudflare: cf.client.bot (bot verificado) y cf.verified_bot_category (su categoría)3.

Primera regla, acción Skip (omitir las demás reglas personalizadas), colocada la primera:

(cf.client.bot and cf.verified_bot_category in {"Search Engine Crawler" "AI Search"})

Segunda regla, acción Block:

(cf.client.bot and cf.verified_bot_category eq "AI Crawler")
or (http.user_agent contains "GPTBot")
or (http.user_agent contains "ClaudeBot")
or (http.user_agent contains "CCBot")
or (http.user_agent contains "Bytespider")
or (http.user_agent contains "meta-externalagent")

Por qué está escrita así:

  1. La categoría «AI Crawler» no incluye a Googlebot (es «Search Engine Crawler») ni a OAI-SearchBot (es «AI Search»), así que esta regla no toca la búsqueda7.
  2. Las líneas de user-agent cubren a quien no esté verificado. contains distingue mayúsculas y «ClaudeBot» no es parte de «Claude-SearchBot», así que no se lo lleva por delante.
  3. Las categorías antiguas siguen funcionando en las reglas del WAF, según Cloudflare, aunque su clasificación nueva use Search, Agent y Training3.

El plan gratuito admite cinco reglas personalizadas, y AI Crawl Control ocupa una si bloqueas algo con él13. Un aviso: bloquear por user-agent no protege de quien lo falsifica. Un scraper que se presenta como Chrome pasa por la segunda regla sin tocarla.

robots.txt, Content Signals y Bot Preference Sync

Las Content Signals son tres preferencias que Cloudflare escribe en robots.txt: search (índice de búsqueda y resultados con enlaces), ai-input (usar el contenido como entrada de un modelo para responder, por ejemplo con RAG) y ai-train (entrenar o ajustar modelos)1. El robots.txt gestionado por Cloudflare añade antes de tu propio fichero esta línea:

User-Agent: *
Content-signal: search=yes, ai-train=no, use=reference
Allow: /

Y debajo, un Disallow: / para Amazonbot, Applebot-Extended, Bytespider, CCBot, ClaudeBot, Google-Extended, GPTBot y meta-externalagent1. Ninguno de ellos es un rastreador de búsqueda. Fíjate en que no declara nada sobre ai-input: la respuesta en tiempo real de un asistente queda sin preferencia.

Dos avisos de la documentación: Search Console puede marcar esas líneas como «Syntax not understood», y Cloudflare dice no haber visto efecto en el rastreo ni en el SEO1. Y desde septiembre, el robots.txt gestionado se sustituye por Bot Preference Sync, que se activa por defecto en los clientes nuevos y antepone sus líneas a tu robots.txt sin borrar tus Disallow11. Si tienes reglas finas del WAF, Cloudflare recomienda apagar la sincronización y escribir el fichero a mano, porque no lee las reglas personalizadas11.

Cómo comprobarlo

  1. Mira el robots.txt servido, no el de tu servidor: abre https://example.com/robots.txt y busca el bloque BEGIN Cloudflare.
  2. Revisa AI Crawl Control > Metrics: muestra los códigos de respuesta por rastreador. Si OAI-SearchBot recibe 403, algo lo está bloqueando.
  3. Prueba con curl pidiendo la página con el user-agent de cada bot:
curl -s -o /dev/null -w "%{http_code}\n" -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; OAI-SearchBot/1.4; +https://openai.com/searchbot" https://example.com/
curl -s -o /dev/null -w "%{http_code}\n" -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.4; +https://openai.com/gptbot" https://example.com/

La prueba con curl tiene un límite que conviene entender: Cloudflare verifica a los bots por su IP, su DNS inverso o su firma, no solo por el user-agent3. Una petición desde tu ordenador con el user-agent de OAI-SearchBot no es un bot verificado. Si el bloqueo depende del user-agent (AI Crawl Control en el plan gratuito, o la segunda regla de arriba), curl lo reproduce. Si depende de la categoría de bot verificado, solo lo verás en las métricas de Cloudflare.

Qué hace SmoothSeen con esto

SmoothSeen pide tu página con el user-agent de cada rastreador de IA y la compara con lo que recibe un navegador y Googlebot: si el cortafuegos responde 403 a OAI-SearchBot o a PerplexityBot mientras sirve la página a los demás, lo señala, aunque robots.txt les deje pasar. También lee el robots.txt servido y separa los rastreadores de búsqueda de los de entrenamiento; vetar a GPTBot o a ClaudeBot no cuenta como fallo. Por lo que explica el apartado anterior, un bloqueo que solo afecta a bots verificados por IP puede no reproducirse desde fuera.

Qué hacer esta semana

Entra en Security Settings de tu zona y apunta qué tienen Search, Training y Agent. Si Training está en «Block», cámbialo a «Disallow AI Training» salvo que quieras salir también de Google. Después, comprueba desde fuera qué ve cada rastreador de IA con una auditoría de Posicionamiento IA.

Preguntas frecuentes

¿Bloquear GPTBot me saca de ChatGPT?

No. Según OpenAI, GPTBot es el rastreador de entrenamiento y la búsqueda de ChatGPT depende de OAI-SearchBot, que se controla por separado. Puedes vetar GPTBot en robots.txt o en Cloudflare y seguir apareciendo en las respuestas de ChatGPT con búsqueda, siempre que OAI-SearchBot pueda entrar y ninguna regla del cortafuegos le devuelva un 403.

¿Cloudflare bloquea los bots de IA por defecto?

Depende de cuándo y cómo diste de alta el dominio. En julio de 2025 Cloudflare anunció el bloqueo por defecto de los rastreadores de IA. Desde el 15-09-2026, los dominios nuevos eligen entre dos configuraciones: sin bloqueos si la web no vive de anuncios, o «Disallow AI Training» y agentes bloqueados en páginas con anuncios si vive de ellos. Revisa siempre Security Settings.

¿Qué diferencia hay entre «Block» y «Disallow AI Training»?

«Block» en Training deja fuera a todos los rastreadores que entrenan, incluidos los que también buscan, como Googlebot, Bingbot y Applebot. «Disallow AI Training» escribe la preferencia de no entrenar en robots.txt, deja pasar a esos tres para la búsqueda y bloquea al resto de rastreadores de entrenamiento, como GPTBot o ClaudeBot.

¿Si permito un bot en robots.txt, puede seguir bloqueado?

Sí. robots.txt y el cortafuegos son capas distintas. El rastreador lee que puede pasar, pide la página y Cloudflare le responde 403 por un ajuste de bots de IA, una regla de AI Crawl Control o una regla personalizada del WAF. Desde fuera solo se nota pidiendo la página como ese bot o mirando las métricas de AI Crawl Control.

Fuentes

  1. 1robots.txt setting, Cloudflare Docs, actualizada el 03-08-2026.
  2. 2Block AI Bots, Cloudflare Docs, actualizada el 01-07-2026.
  3. 3Verified bots, Cloudflare Docs, actualizada el 01-07-2026.
  4. 4Overview of OpenAI Crawlers, OpenAI, consultada el 07-10-2026.
  5. 5Does Anthropic crawl data from the web, and how can site owners block the crawler?, Anthropic, consultada el 07-10-2026.
  6. 6Perplexity Crawlers, Perplexity, consultada el 07-10-2026.
  7. 7Bot reference, Cloudflare AI Crawl Control Docs, actualizada el 23-04-2026.
  8. 8Google's common crawlers, Google Search Central, actualizada el 14-07-2026.
  9. 9Content Independence Day: no AI crawl without compensation!, Matthew Prince, blog de Cloudflare, 01-07-2025.
  10. 10Have it both ways: stay discoverable in search while disallowing AI training, Bryan Becker, blog de Cloudflare, 15-09-2026.
  11. 11Say it once: introducing Bot Preference Sync, Jin-Hee Lee, blog de Cloudflare, 21-08-2026.
  12. 12Manage AI crawlers, Cloudflare AI Crawl Control Docs, actualizada el 28-07-2026.
  13. 13AI Crawl Control with Cloudflare WAF, Cloudflare Docs, actualizada el 03-08-2026; límites por plan en Custom rules, consultada el 07-10-2026.
  14. 14Create a custom rule in the dashboard, Cloudflare Docs, actualizada el 03-08-2026.

Cómo citar este artículo

SmoothSeen. (2026, 7 de octubre). Bloquear bots de IA en Cloudflare sin desaparecer de ChatGPT ni de Google. https://smoothseen.com/es/blog/cloudflare-bloquear-bots-ia/

Quién lo escribe

SmoothSeen es una herramienta de auditoría web que mide el posicionamiento en buscadores y en asistentes de IA y entrega informes con la marca de la agencia.

Este blog es de SmoothSeen: cuando un artículo habla del producto, lo hace sabiendo que es el nuestro. Las cifras de terceros enlazan a su fuente original.

Historial de cambios

  • Primera versión.

Sigue leyendo

Bloquear bots de IA en Cloudflare sin salir de ChatGPT