Bloquear GPTBot y otros bots de IA en robots.txt sin dejar de salir en sus respuestas
Publicado el 07-10-202610 min de lecturaPor la redacción de SmoothSeen
Puedes bloquear GPTBot en robots.txt con User-agent: GPTBot y Disallow: /, y eso solo impide que OpenAI use tu contenido para entrenar sus modelos. No te saca de la búsqueda de ChatGPT, que depende de otro rastreador, OAI-SearchBot. Las grandes empresas de IA ya separan sus rastreadores por uso, así que puedes vetar el entrenamiento y seguir siendo citable.
Lo esencial
- Vetar GPTBot en robots.txt solo impide que OpenAI entrene con tu contenido; la búsqueda de ChatGPT depende de OAI-SearchBot.
- Las grandes empresas de IA separan sus rastreadores en tres usos, búsqueda, visitas a petición del usuario y entrenamiento, y cada uno se veta por separado.
- Google-Extended no toca Google Search, pero también decide si la app Gemini puede fundamentar sus respuestas en tu web.
- robots.txt es una petición, no un cerrojo, y los agentes que actúan a petición de un usuario avisan de que pueden no seguirlo.
- Un cortafuegos, una CDN o un WAF pueden devolver un 403 a esos rastreadores aunque tu robots.txt los deje pasar; se comprueba con curl y su user-agent.
Para comprobarlo en tu web: Auditoría de visibilidad en IA
En esta página
- ¿Qué rastreadores de IA hay y para qué sirve cada uno?
- ¿Por qué no es lo mismo búsqueda, petición del usuario y entrenamiento?
- Un robots.txt para que te citen sin entrenar con tu web
- robots.txt es una petición, no un cerrojo
- El veto que no está en robots.txt: cortafuegos, CDN y WAF
- Cómo comprobar con curl qué ve cada rastreador
- Qué revisa SmoothSeen de todo esto
- Preguntas frecuentes
- Qué hacer ahora
El matiz importa porque durante años se repitió lo contrario: que vetar «a los bots de IA» te borraba de los asistentes. La pieza encaja dentro del posicionamiento en IA, donde el acceso de los rastreadores es el primer bloque que hay que revisar. Aquí está la lista completa, comprobada el 07-10-2026 en la documentación de cada empresa, un robots.txt de ejemplo y la forma de ver si tu servidor deja pasar lo que tu robots.txt promete.
¿Qué rastreadores de IA hay y para qué sirve cada uno?
Un rastreador de IA es un programa que pide páginas web en nombre de una empresa de inteligencia artificial y se identifica con un nombre propio en la cabecera User-agent. Ese nombre es el que escribes en robots.txt. Cada empresa publica los suyos y explica para qué los usa:
- Empresa
- OpenAI
- Rastreador
- OAI-SearchBot
- Uso
- Búsqueda: mostrar webs en las respuestas de ChatGPT
- ¿Sigue robots.txt?
- Sí
- Empresa
- OpenAI
- Rastreador
- ChatGPT-User
- Uso
- A petición del usuario, no rastreo automático
- ¿Sigue robots.txt?
- OpenAI avisa de que sus reglas pueden no aplicarse
- Empresa
- OpenAI
- Rastreador
- GPTBot
- Uso
- Entrenamiento de sus modelos
- ¿Sigue robots.txt?
- Sí
- Empresa
- OpenAI
- Rastreador
- OAI-AdsBot
- Uso
- Revisar páginas enviadas como anuncio en ChatGPT; no entrena
- ¿Sigue robots.txt?
- La documentación no lo detalla
- Empresa
- Anthropic
- Rastreador
- Claude-SearchBot
- Uso
- Búsqueda: indexar para los resultados de Claude
- ¿Sigue robots.txt?
- Sí
- Empresa
- Anthropic
- Rastreador
- Claude-User
- Uso
- A petición del usuario, cuando Claude consulta una página
- ¿Sigue robots.txt?
- Sí, según Anthropic
- Empresa
- Anthropic
- Rastreador
- ClaudeBot
- Uso
- Entrenamiento
- ¿Sigue robots.txt?
- Sí
- Empresa
- Perplexity
- Rastreador
- PerplexityBot
- Uso
- Búsqueda: enlazar webs en sus resultados; no entrena
- ¿Sigue robots.txt?
- Sí
- Empresa
- Perplexity
- Rastreador
- Perplexity-User
- Uso
- A petición del usuario
- ¿Sigue robots.txt?
- Por lo general lo ignora
- Empresa
- Rastreador
- Googlebot
- Uso
- Google Search, incluidas AI Overviews y AI Mode
- ¿Sigue robots.txt?
- Sí
- Empresa
- Rastreador
- Google-Extended
- Uso
- No es un rastreador: es una marca para robots.txt sobre el entrenamiento de Gemini y el grounding
- ¿Sigue robots.txt?
- Sí
- Empresa
- Rastreador
- Google-Agent y otros
- Uso
- A petición del usuario
- ¿Sigue robots.txt?
- Por lo general lo ignoran
- Empresa
- Apple
- Rastreador
- Applebot
- Uso
- Búsqueda en Spotlight, Siri y Safari; sus datos pueden entrenar modelos de Apple
- ¿Sigue robots.txt?
- Sí
- Empresa
- Apple
- Rastreador
- Applebot-Extended
- Uso
- No rastrea: decide si lo que recoge Applebot entrena modelos de Apple
- ¿Sigue robots.txt?
- Sí
- Empresa
- Meta
- Rastreador
- Meta-WebIndexer
- Uso
- Mejorar los resultados de búsqueda de Meta AI
- ¿Sigue robots.txt?
- La documentación no lo detalla
- Empresa
- Meta
- Rastreador
- meta-externalagent
- Uso
- Entrenamiento de modelos y mejora de productos
- ¿Sigue robots.txt?
- Sí
- Empresa
- Meta
- Rastreador
- Meta-ExternalFetcher
- Uso
- A petición del usuario
- ¿Sigue robots.txt?
- Puede saltárselo
- Empresa
- Amazon
- Rastreador
- Amzn-SearchBot
- Uso
- Búsqueda en productos de Amazon; no entrena
- ¿Sigue robots.txt?
- Sí
- Empresa
- Amazon
- Rastreador
- Amazonbot
- Uso
- Mejora de productos; puede entrenar modelos de Amazon
- ¿Sigue robots.txt?
- Sí
- Empresa
- Amazon
- Rastreador
- Amzn-User
- Uso
- A petición del usuario, como consultas a Alexa
- ¿Sigue robots.txt?
- Puede no seguir todas sus reglas
- Empresa
- Common Crawl
- Rastreador
- CCBot
- Uso
- Archivo abierto de la web que cualquiera puede descargar
- ¿Sigue robots.txt?
- Sí, incluido
Crawl-delay
Las fuentes de cada fila son la documentación de OpenAI1, Anthropic2, Perplexity3, Google45, Apple6, Meta7, Amazon8 y Common Crawl9. Los nombres cambian y aparecen rastreadores nuevos, así que conviene revisar la lista cada pocos meses.
¿Por qué no es lo mismo búsqueda, petición del usuario y entrenamiento?
Porque cada uso tiene una consecuencia distinta para ti, y las empresas los separan precisamente para que decidas uno a uno.
Búsqueda. Estos rastreadores leen tu web para que el asistente pueda citarla en sus respuestas. OpenAI lo dice sin rodeos: los sitios que vetan OAI-SearchBot no se muestran en las respuestas de búsqueda de ChatGPT, aunque pueden aparecer como enlace de navegación1. Anthropic avisa de que vetar Claude-SearchBot puede reducir tu visibilidad en sus resultados2. Si quieres que te citen, estos tienen que entrar. Cómo trabaja cada asistente con ellos está en las guías de posicionamiento en ChatGPT y de posicionamiento en Perplexity.
Petición del usuario. Son visitas que lanza una persona desde el asistente, por ejemplo al pegar un enlace y pedir un resumen. No rastrean por su cuenta, y por eso varias empresas avisan de que pueden no seguir el robots.txt: OpenAI con ChatGPT-User, Perplexity con Perplexity-User, Google con sus agentes y Meta con Meta-ExternalFetcher1357.
Entrenamiento. GPTBot, ClaudeBot, meta-externalagent o Amazonbot recogen contenido que puede usarse para entrenar modelos. Vetarlos es una decisión editorial legítima: OpenAI deja claro que cada ajuste es independiente y que puedes permitir OAI-SearchBot mientras vetas GPTBot1.
Hay dos casos que no encajan del todo. Google-Extended no tiene user-agent propio: Google rastrea con sus agentes de siempre y usa esta marca para saber si puede entrenar Gemini con tu contenido y usarlo para fundamentar (grounding) las respuestas de la app Gemini y de la búsqueda de Vertex AI. Google añade que no afecta a tu inclusión en Google Search ni es una señal de posicionamiento4. Applebot-Extended tampoco rastrea: vetarlo saca tu contenido del entrenamiento de Apple, pero tus páginas siguen pudiendo salir en Spotlight, Siri y Safari6.
Un robots.txt para que te citen sin entrenar con tu web
Este ejemplo deja pasar a la búsqueda de cada asistente y veta el entrenamiento. Usa example.com, el dominio reservado para ejemplos; cambia las rutas privadas por las tuyas:
# 1. Búsqueda con IA: te leen para citarte en sus respuestas.
# Tienen grupo propio, así que no heredan las reglas de «*»:
# las rutas privadas se repiten aquí.
User-agent: OAI-SearchBot
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Amzn-SearchBot
User-agent: Meta-WebIndexer
Disallow: /carrito/
Disallow: /mi-cuenta/
# 2. Entrenamiento de modelos y archivos abiertos: vetados.
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: meta-externalagent
User-agent: Amazonbot
User-agent: Applebot-Extended
User-agent: CCBot
Disallow: /
# 3. Google-Extended veta el entrenamiento de Gemini, pero también
# el grounding de la app Gemini. Descomenta solo si aceptas ese coste.
# User-agent: Google-Extended
# Disallow: /
# 4. Todos los demás, incluido Googlebot: AI Overviews y AI Mode
# dependen de él, no de un rastreador de IA aparte.
User-agent: *
Disallow: /carrito/
Disallow: /mi-cuenta/
Sitemap: https://www.example.com/sitemap.xmlTres decisiones explican su forma. La primera: varios User-agent seguidos comparten las reglas que vienen detrás, y según el estándar de robots.txt (RFC 9309) un rastreador que encuentra un grupo con su nombre obedece ese grupo y solo recurre al de * si ninguno lo nombra10. Por eso el grupo 1 repite las rutas privadas. La segunda: los agentes a petición del usuario (ChatGPT-User, Perplexity-User) no aparecen porque sus dueños no se comprometen a seguir el archivo; nombrarlos da una falsa sensación de control. La tercera: Google-Extended va comentado porque vetarlo puede reducir lo que Gemini cite de ti.
Un detalle que conviene saber si usas Cloudflare: su robots.txt gestionado añade delante del tuyo un veto a Amazonbot, Applebot-Extended, Bytespider, CCBot, ClaudeBot, Google-Extended, GPTBot y meta-externalagent11. Incluye Google-Extended, con el coste en Gemini que acabas de ver.
Para AI Overviews y AI Mode no hay rastreador ni marca propios: se rigen por Googlebot y por los controles de fragmento de siempre, como se explica en la guía para aparecer en AI Overviews.
robots.txt es una petición, no un cerrojo
Google lo explica en su introducción al archivo: las instrucciones de robots.txt no pueden imponer un comportamiento a los rastreadores, y depende de cada uno obedecerlas12. El RFC 9309 lo dice de otra forma: sus reglas no son una forma de autorización de acceso10.
Eso tiene tres consecuencias prácticas:
- Los rastreadores serios lo respetan, los demás no tienen por qué. OpenAI, Anthropic, Perplexity, Google, Apple, Amazon y Common Crawl documentan que siguen sus reglas en el rastreo automático. Un rastreador sin documentación o que se hace pasar por un navegador no te debe nada.
- Las visitas a petición del usuario pueden saltárselo. Lo dicen OpenAI, Perplexity, Google y Meta de sus propios agentes. Si necesitas que un contenido no lo lea nadie, ponlo tras una contraseña.
- robots.txt no saca una página de un índice. Google lo usa para gestionar el rastreo, no para mantener páginas fuera de su buscador; para eso está
noindex12. La guía de SEO técnico explica la diferencia con más detalle.
También tarda: OpenAI dice que sus sistemas pueden necesitar unas 24 horas para reflejar un cambio de robots.txt en la búsqueda1.
El veto que no está en robots.txt: cortafuegos, CDN y WAF
Tu robots.txt dice lo que declaras; tu servidor puede hacer otra cosa. Muchos alojamientos, CDN y cortafuegos de aplicaciones web (WAF) traen reglas que responden con un 403 Forbidden a ciertos user-agents. Si esas reglas incluyen a PerplexityBot u OAI-SearchBot, el rastreador ni siquiera llega a leer tu robots.txt, y tú no lo ves en ningún panel.
El caso más extendido es Cloudflare. El 01-07-2025 anunció que cambiaba su comportamiento por defecto para bloquear los rastreadores de IA salvo que paguen a los creadores del contenido13. Desde el 01-07-2026, todos sus clientes pueden decidir por separado sobre tres comportamientos: búsqueda, agentes que actúan en nombre de una persona y entrenamiento. Desde el 15-09-2026, los dominios nuevos empiezan con el entrenamiento y los agentes bloqueados en las páginas que muestran anuncios, y con la búsqueda permitida14. Hay otro matiz en su documentación: un rastreador que sirve a la vez para búsqueda y entrenamiento queda bloqueado en cualquier configuración que bloquee el entrenamiento14.
Si tu web pasa por Cloudflare o por otra CDN, revisa esos ajustes antes de dar por bueno tu robots.txt. OpenAI pide además que tu alojamiento acepte las IP que publica para cada rastreador, en ficheros como openai.com/searchbot.json1.
Cómo comprobar con curl qué ve cada rastreador
Con curl puedes pedir tu página haciéndote pasar por un rastreador y comparar la respuesta con la de un navegador. Cambia example.com por tu dominio:
# 1. Testigo: un navegador normal. Debe dar 200.
curl -s -o /dev/null -w "%{http_code}\n" -A "Mozilla/5.0 (Windows NT 10.0; Win64; x64) Chrome/128.0 Safari/537.36" https://www.example.com/
# 2. Los rastreadores de búsqueda, con el token que publica su empresa.
for ua in OAI-SearchBot Claude-SearchBot PerplexityBot; do
printf "%s: " "$ua"
curl -s -o /dev/null -w "%{http_code}\n" -A "Mozilla/5.0 (compatible; $ua/1.0)" https://www.example.com/
done
# 3. ¿Qué dice tu robots.txt? Lee lo que se sirve de verdad,
# incluido lo que añada tu CDN delante.
curl -s https://www.example.com/robots.txtCómo leer el resultado:
- Navegador
- 200
- Rastreador
- 200
- Qué significa
- Ninguna regla filtra por ese nombre. No garantiza que el rastreador real pase si el cortafuegos comprueba también la IP
- Navegador
- 200
- Rastreador
- 403, 401, 406 o 451
- Qué significa
- Hay una regla que rechaza ese user-agent. Búscala en tu CDN, tu WAF o la configuración del alojamiento
- Navegador
- 403 o 503
- Rastreador
- Cualquiera
- Qué significa
- El servidor rechaza también al navegador desde tu red: la prueba no es concluyente
- Navegador
- 200
- Rastreador
- 429 o 5xx
- Qué significa
- Límite de peticiones o error del servidor: repite más tarde antes de sacar conclusiones
Un 403 al rastreador con un 200 al navegador es la señal más clara de un veto fuera de robots.txt. Para confirmar que el rastreador real entra, busca su nombre en los registros de acceso de tu servidor y cruza las IP con las listas oficiales.
Qué revisa SmoothSeen de todo esto
SmoothSeen lee tu robots.txt y te enseña, rastreador a rastreador, si deja pasar a los de búsqueda, a los de petición del usuario y a los de entrenamiento, cada grupo con su consecuencia. Vetar el entrenamiento no se presenta como un fallo, porque no lo es. Además pide la página con el user-agent de cada rastreador, la compara con la respuesta a un navegador y te avisa si el servidor rechaza a alguno aunque el robots.txt lo permita. Lo verás dentro de la mitad de Posicionamiento IA del análisis.
Lo que no puede afirmar nadie es que «todos» los bots de IA estén permitidos o bloqueados: no existe un registro completo y aparecen rastreadores nuevos cada pocos meses. SmoothSeen comprueba una lista cerrada de los documentados y te dice cuáles son.
Preguntas frecuentes
¿Bloquear GPTBot me saca de ChatGPT?
No. GPTBot es el rastreador de entrenamiento de OpenAI: vetarlo indica que tu contenido no debe usarse para entrenar sus modelos. Lo que decide si sales en las respuestas de búsqueda de ChatGPT es OAI-SearchBot, que se configura por separado. OpenAI lo pone como ejemplo en su documentación: puedes permitir OAI-SearchBot para aparecer en la búsqueda y vetar GPTBot a la vez.
¿Bloquear Google-Extended afecta a AI Overviews?
No, según Google. Google-Extended no afecta a tu inclusión en Google Search ni es una señal de posicionamiento, y AI Overviews y AI Mode forman parte de Search, que rastrea Googlebot. Lo que sí controla, además del entrenamiento de Gemini, es si la app Gemini y la búsqueda de Vertex AI pueden usar tu contenido para fundamentar sus respuestas. Ese es el coste real de vetarlo.
¿Cómo veto a todos los bots de IA de una vez?
No hay una línea que lo haga. robots.txt funciona por nombre, y cada empresa usa los suyos, que además cambian. Puedes vetar la lista de esta guía, pero los rastreadores que no se identifican o no respetan el archivo seguirán entrando. Para frenarlos de verdad hace falta una regla en tu CDN o tu cortafuegos, o poner el contenido detrás de una contraseña.
¿Por qué mi robots.txt permite a PerplexityBot y aun así no me cita?
Puede haber un veto fuera del archivo. Si un cortafuegos, una CDN o tu alojamiento responden con un 403 al user-agent de PerplexityBot, el rastreador no llega a leer la página aunque el robots.txt lo permita. Compruébalo con curl comparando la respuesta a un navegador con la respuesta a PerplexityBot. Si los dos dan 200, el motivo está en otra parte: el contenido, la indexación o la competencia.
Qué hacer ahora
Abre tu robots.txt tal como se sirve, comprueba que ningún grupo veta a OAI-SearchBot, Claude-SearchBot ni PerplexityBot y decide aparte qué hacer con el entrenamiento. Después pasa la prueba de curl para descartar un veto del servidor. El resto de bloques que deciden si te citan están en la guía de posicionamiento en IA.
Fuentes
- 1Overview of OpenAI Crawlers, OpenAI, consultada el 07-10-2026.
- 2Does Anthropic crawl data from the web, and how can site owners block the crawler?, Anthropic (Claude Help Center), actualizada el 07-04-2026.
- 3Perplexity Crawlers, Perplexity, consultada el 07-10-2026.
- 4Google's common crawlers, Google Crawling Infrastructure, actualizada el 14-07-2026.
- 5Google User-Triggered Fetchers, Google Crawling Infrastructure, actualizada el 19-08-2026.
- 6About Applebot, Apple, actualizada el 04-09-2026.
- 7Meta Web Crawlers, Meta for Developers, consultada el 07-10-2026.
- 8About AmazonBot, Amazon Developer, consultada el 07-10-2026.
- 9CCBot, Common Crawl, consultada el 07-10-2026.
- 10RFC 9309: Robots Exclusion Protocol, IETF, publicada en septiembre de 2022.
- 11robots.txt setting, Cloudflare Docs, actualizada el 03-08-2026.
- 12Introduction to robots.txt, Google Search Central, actualizada el 10-12-2025.
- 13Content Independence Day: no AI crawl without compensation!, Matthew Prince, Cloudflare Blog, 01-07-2025.
- 14Block AI Bots, Cloudflare Docs, actualizada el 01-07-2026.
Cómo citar este artículo
SmoothSeen. (2026, 7 de octubre). Bloquear GPTBot y otros bots de IA en robots.txt sin dejar de salir en sus respuestas. https://smoothseen.com/es/blog/bots-ia-robots-txt/
Sigue leyendo
Posicionamiento en IA: guía de AEO y GEO para que ChatGPT, Gemini y Google te citen
Qué es el posicionamiento en IA (AEO y GEO), cómo eligen fuentes ChatGPT, Gemini y Google, qué bots dejar pasar y una checklist por bloques.
AEO, GEO y SEO: qué es cada uno y en qué se diferencian (con ejemplos)
Diferencia entre AEO, GEO y SEO: qué busca cada uno, dónde aparece el resultado, qué señales pesan y cómo se mide. Con tabla y un ejemplo.
Bloquear bots de IA en Cloudflare sin desaparecer de ChatGPT ni de Google
Qué ajuste de Cloudflare elegir para frenar el entrenamiento de IA sin bloquear a OAI-SearchBot, PerplexityBot ni Googlebot. Con reglas de WAF probadas.