Saltar al contenido

robots.txt en WordPress para rastreadores de IA: qué permitir, qué vetar y llms.txt

Publicado el 07-10-20269 min de lecturaPor la redacción de SmoothSeen

El robots.txt de WordPress es un fichero virtual que genera el núcleo y que puedes ampliar con el filtro robots_txt, con Yoast SEO o con Rank Math. Para la IA, deja pasar a los rastreadores de búsqueda (OAI-SearchBot, Claude-SearchBot, PerplexityBot) y veta, si quieres, los de entrenamiento (GPTBot, ClaudeBot, Google-Extended). El llms.txt es opcional y sin efecto demostrado.

Lo esencial

  • WordPress genera un robots.txt virtual con la función do_robots y lo deja ampliar con el filtro robots_txt; un fichero robots.txt físico en la raíz lo sustituye por completo.
  • Desde WordPress 5.3, la casilla que pide a los buscadores que no indexen el sitio usa una etiqueta meta robots noindex y ya no añade Disallow en robots.txt.
  • OAI-SearchBot, Claude-SearchBot, Claude-User y PerplexityBot deciden si ChatGPT, Claude y Perplexity pueden citarte; GPTBot, ClaudeBot, Google-Extended y Applebot-Extended controlan el entrenamiento.
  • Yoast SEO (desde la 25.3, junio de 2025) y Rank Math generan llms.txt, pero Google dice que no lo necesita y ningún buscador de IA ha documentado que lo lea.
  • Un plugin de seguridad, el alojamiento o el cortafuegos pueden responder 403 a un bot que robots.txt permite, y eso no se ve en robots.txt.

Para comprobarlo en tu web: Auditoría de visibilidad en IA

En esta página

Un robots.txt es un fichero de texto en la raíz del dominio que dice a cada rastreador qué rutas puede pedir. No es una barrera: lo respetan los rastreadores que deciden respetarlo. En WordPress, el núcleo escribe uno por ti, los plugins de SEO lo amplían y el servidor, el alojamiento o la CDN pueden contradecirlo sin que lo veas. Esta guía explica qué controla cada pieza y cómo dejar el fichero para que los buscadores de IA puedan citarte.

¿Qué contiene el robots.txt que genera WordPress?

Si no hay un fichero robots.txt en la raíz, WordPress responde a esa URL con la función do_robots(). En la versión actual, la 7.1, el contenido base es este, con el sitio visible para los buscadores1:

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://www.ejemplo.es/wp-sitemap.xml

Las dos primeras reglas apartan el escritorio y dejan abierto admin-ajax.php, que usan muchos temas en la parte pública. La línea Sitemap la añade el mapa del sitio del núcleo, y solo cuando el sitio es público1. Si usas Yoast SEO o Rank Math, el sitemap que aparece es el suyo.

Todo pasa por el filtro robots_txt, que existe desde WordPress 3.0 y recibe el texto y un segundo parámetro que indica si el sitio es público2. Es la vía que usan los plugins para escribir en el fichero.

Un matiz que provoca muchas confusiones: si subes un robots.txt físico a la raíz, el servidor lo entrega directamente y WordPress no interviene. Ni el filtro ni los plugins pueden cambiarlo. Rank Math lo dice en su documentación: para editar el fichero desde el plugin hay que borrar antes el físico3.

¿Qué hace la opción de pedir a los buscadores que no indexen el sitio?

En Ajustes > Lectura, el apartado Visibilidad en los motores de búsqueda tiene la casilla Pedir a los motores de búsqueda que no indexen este sitio. Desde WordPress 5.3 ya no añade Disallow: / al robots.txt: pone en cada página una etiqueta <meta name='robots' content='noindex,nofollow' />4. El motivo que dio el equipo de WordPress es que una web puede aparecer en los resultados sin haber sido rastreada, si otras enlazan a ella4.

Dos consecuencias:

  • Con la casilla marcada, tu robots.txt sigue dejando pasar a todos. El veto está en el HTML de cada página.
  • Si añades reglas con el filtro robots_txt, comprueba el segundo parámetro: en un sitio en desarrollo con la casilla marcada probablemente no quieras tocar nada.

Búsqueda frente a entrenamiento: qué decide cada rastreador

Esta es la parte que más se confunde. Unos rastreadores deciden si un asistente puede citarte en sus respuestas; otros, si tu contenido puede usarse para entrenar modelos. Vetar los segundos es una decisión editorial legítima y no te saca de las respuestas.

Rastreador
OAI-SearchBot
Empresa
OpenAI
Para qué sirve, según su dueño
Búsqueda de ChatGPT
Si lo vetas
No apareces en las respuestas de búsqueda de ChatGPT5
Rastreador
GPTBot
Empresa
OpenAI
Para qué sirve, según su dueño
Entrenamiento de modelos
Si lo vetas
Tu contenido no se usa para entrenar; no afecta a la búsqueda5
Rastreador
Claude-SearchBot
Empresa
Anthropic
Para qué sirve, según su dueño
Mejorar los resultados de búsqueda de Claude
Si lo vetas
Puede reducir tu visibilidad en Claude6
Rastreador
Claude-User
Empresa
Anthropic
Para qué sirve, según su dueño
Visitar páginas cuando un usuario de Claude lo pide
Si lo vetas
Puede reducir tu visibilidad en Claude6
Rastreador
ClaudeBot
Empresa
Anthropic
Para qué sirve, según su dueño
Entrenamiento de modelos
Si lo vetas
Tu contenido futuro sale de sus datos de entrenamiento6
Rastreador
PerplexityBot
Empresa
Perplexity
Para qué sirve, según su dueño
Mostrar y enlazar webs en sus resultados; no entrena modelos
Si lo vetas
No apareces en sus resultados7
Rastreador
Google-Extended
Empresa
Google
Para qué sirve, según su dueño
Token de robots.txt para el entrenamiento de Gemini y el grounding en sus aplicaciones
Si lo vetas
No afecta a tu inclusión en Google Search8
Rastreador
Applebot-Extended
Empresa
Apple
Para qué sirve, según su dueño
No rastrea: decide si Apple usa lo que ya recogió Applebot para entrenar
Si lo vetas
Tu contenido no se usa para entrenar sus modelos9
Rastreador
CCBot
Empresa
Common Crawl
Para qué sirve, según su dueño
Archivo abierto de la web, que usan también investigadores de IA
Si lo vetas
Sales de su archivo10

Tres avisos que cambian decisiones. OpenAI dice que cada ajuste es independiente: puedes permitir OAI-SearchBot y vetar GPTBot5. ChatGPT-User actúa a petición de un usuario y OpenAI avisa de que puede no seguir robots.txt5; Perplexity dice lo mismo de Perplexity-User7. Y AI Overviews y AI Mode forman parte de Google Search: dependen de Googlebot, no de Google-Extended11.

Un robots.txt para WordPress, comentado

Este ejemplo deja pasar a todos los rastreadores, incluidos los de búsqueda de IA, salvo al escritorio, y veta el entrenamiento:

# Regla general. Aquí entran Googlebot, Bingbot y los buscadores
# de IA (OAI-SearchBot, Claude-SearchBot, Claude-User, PerplexityBot):
# pueden rastrear todo menos el escritorio.
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

# Entrenamiento de modelos: vetado (decisión editorial).
# Vetarlos no te saca de ChatGPT, Claude, Perplexity ni Google Search.
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: CCBot
User-agent: meta-externalagent
Disallow: /

Sitemap: https://www.ejemplo.es/wp-sitemap.xml

Por qué no hay un bloque propio para los buscadores de IA: Google explica que cada rastreador obedece solo al grupo con el user-agent más específico que le corresponde12. Si creas un grupo User-agent: OAI-SearchBot, ese bot deja de leer las reglas del grupo general y tendrías que repetirlas. Mientras quieras tratarlos igual que a Googlebot, el grupo general basta.

Cómo editar el robots.txt en WordPress

Elige una sola vía. Si combinas un fichero físico, un plugin y un filtro, es fácil que el resultado no sea el que crees.

Con Yoast SEO

Su documentación indica Yoast SEO > Tools > File editor (las etiquetas de su ayuda están en inglés). El menú solo aparece si el fichero se puede escribir y si la edición de ficheros no está desactivada en tu instalación; si no, Yoast propone crear el fichero por FTP13.

Con Rank Math

Activa el modo avanzado y entra en Rank Math SEO > General Settings > Edit robots.txt. Rank Math genera un fichero virtual, así que antes tienes que borrar el robots.txt físico si existe3.

Con un filtro en PHP

Si no usas plugin de SEO, o prefieres el código, un mu-plugin con el filtro robots_txt añade el bloque de entrenamiento al final del fichero del núcleo. Guárdalo en wp-content/mu-plugins/robots-ia.php:

<?php
/**
 * Plugin Name: robots.txt para rastreadores de IA
 * Description: Veta el entrenamiento de modelos sin tocar a los buscadores de IA.
 */

if ( ! defined( 'ABSPATH' ) ) {
	exit;
}

add_filter( 'robots_txt', function ( $output, $is_public ) {
	// Si el sitio pide a los buscadores que no lo indexen, no toques nada.
	if ( ! $is_public ) {
		return $output;
	}

	$entrenamiento = array(
		'GPTBot',
		'ClaudeBot',
		'Google-Extended',
		'Applebot-Extended',
		'CCBot',
		'meta-externalagent',
	);

	$output .= "\n# Entrenamiento de modelos: vetado (decisión editorial)\n";
	foreach ( $entrenamiento as $bot ) {
		$output .= "User-agent: {$bot}\n";
	}
	$output .= "Disallow: /\n";

	return $output;
}, 20, 2 );

Varias líneas User-agent seguidas forman un único grupo que comparte las reglas de debajo12. No funciona si existe un robots.txt físico.

¿Necesitas un llms.txt en WordPress?

llms.txt es una propuesta de Jeremy Howard (septiembre de 2024) para publicar en /llms.txt un resumen en Markdown del sitio con enlaces a sus páginas principales, pensado para que lo lean los modelos de lenguaje14. No es un estándar y ningún buscador de IA ha documentado que lo use. Google dice que no hace falta ningún fichero de texto para IA para aparecer en sus funciones de IA11 y aclaró en junio de 2026 que estos ficheros no ayudan ni perjudican en Google Search, aunque puedes mantenerlos para otros servicios15.

Si aun así quieres tenerlo, es barato:

  • Yoast SEO lo genera desde la versión 25.3 (10-06-2025)16. Según su ayuda: Yoast SEO > Settings > Site Features, apartado AI tools, opción LLMS.txt17. Permite que Yoast elija el contenido, dando prioridad al que marques como cornerstone, o elegirlo tú.
  • Rank Math tiene un módulo LLMS Txt que se activa en Rank Math SEO > Dashboard y se configura en General Settings > Edit llms.txt18. Su documentación no indica desde qué versión existe, y la propia guía lo presenta como una propuesta, no como un estándar oficial18.

Trátalo como un extra opcional: primero el robots.txt y el acceso real de los rastreadores. Qué datos hay sobre si alguien lo lee está en la guía de llms.txt.

Cuando robots.txt dice sí y el servidor dice no

Un robots.txt que permite a OAI-SearchBot no sirve de nada si el servidor le responde con un 403. En WordPress eso pasa más de lo que parece:

  • Plugins de seguridad con reglas que bloquean user-agents «sospechosos» o listas de bots.
  • El cortafuegos del alojamiento, que a veces bloquea rastreadores sin avisarte.
  • La CDN. Cloudflare, por ejemplo, tiene un ajuste para bloquear bots de IA; lo explica la guía de Cloudflare y los bots de IA.

Un veto por user-agent en el servidor es tan efectivo como uno en robots.txt, pero no se ve leyendo el fichero. Y al revés: bloquear por user-agent no te protege de quien se hace pasar por otro bot. Anthropic, además, desaconseja bloquear por IP, porque puede impedir que su bot lea tu robots.txt6.

Cómo comprobarlo

  1. Abre https://www.ejemplo.es/robots.txt en el navegador y lee lo que se sirve de verdad.
  2. Revisa el informe de robots.txt de Search Console: muestra qué fichero encontró Google, cuándo lo rastreó y si tuvo errores, y permite pedir que lo vuelva a leer19.
  3. Pide una página con un user-agent que contenga el nombre del bot y compara el código de respuesta con el de un navegador. Es una aproximación: algunos cortafuegos verifican también la IP.
curl -sI -A "Mozilla/5.0 (compatible; OAI-SearchBot/1.0; +https://openai.com/searchbot)" https://www.ejemplo.es/
curl -sI https://www.ejemplo.es/

Qué hace SmoothSeen con esto

SmoothSeen lee el robots.txt de la página que analizas y separa los rastreadores de búsqueda de IA de los de entrenamiento: vetar a los de entrenamiento no se cuenta como fallo. Además pide la página con el user-agent de cada rastreador de IA, de un navegador y de Googlebot, para detectar si el servidor o el cortafuegos responde 403 a alguno, y comprueba si existe llms.txt. Todo entra en la nota de Posicionamiento IA.

Qué hacer esta semana

Abre tu /robots.txt, comprueba que OAI-SearchBot, Claude-SearchBot y PerplexityBot no estén vetados y decide qué haces con los de entrenamiento. Luego prueba con curl que tu servidor no les devuelve 403. Si quieres ver todos esos accesos comprobados de una vez, haz una auditoría de visibilidad en IA.

Preguntas frecuentes

¿Dónde está el robots.txt en WordPress si no lo veo por FTP?

No está en ningún sitio: WordPress lo genera al vuelo cuando alguien pide /robots.txt y no existe un fichero con ese nombre en la raíz. Por eso no aparece en el FTP ni en el gestor de archivos del alojamiento. Para cambiarlo usa un plugin de SEO o el filtro robots_txt, o crea un fichero físico, sabiendo que entonces WordPress deja de intervenir.

¿Si veto a GPTBot desaparezco de ChatGPT?

No. GPTBot es el rastreador que OpenAI usa para entrenar modelos, y su documentación dice que cada ajuste es independiente. Lo que decide si apareces en las respuestas de búsqueda de ChatGPT es OAI-SearchBot. Puedes vetar GPTBot y dejar pasar a OAI-SearchBot, y es una combinación habitual entre quienes quieren que les citen sin ceder su contenido para entrenamiento.

¿Google-Extended afecta a AI Overviews o a AI Mode?

No. Google-Extended es un token de robots.txt que controla si Google usa tu contenido para entrenar Gemini y para el grounding en sus aplicaciones, y Google afirma que no afecta a la inclusión en Google Search ni es una señal de posicionamiento. AI Overviews y AI Mode forman parte de la búsqueda y dependen de Googlebot; para limitarlos, Google remite a nosnippet y noindex.

¿Yoast SEO o Rank Math crean el llms.txt automáticamente?

Solo si activas la función. En Yoast SEO está en los ajustes de funciones del sitio, en el apartado de herramientas de IA, y la incluye la versión gratuita. En Rank Math es un módulo que se activa desde su panel. En ambos casos el fichero se publica en la raíz del dominio; recuerda que es opcional y que Google no lo usa.

Fuentes

  1. 1Código fuente de WordPress 7.1: functions.php (do_robots) y class-wp-sitemaps.php, WordPress (repositorio oficial wordpress-develop), consultado el 07-10-2026.
  2. 2do_robots(), WordPress Developer Resources, consultada el 07-10-2026.
  3. 3Using Rank Math's robots.txt generator, Rank Math, consultada el 07-10-2026.
  4. 4Changes to prevent search engines indexing sites, Make WordPress Core, 02-09-2019.
  5. 5Overview of OpenAI Crawlers, OpenAI, consultada el 07-10-2026.
  6. 6Does Anthropic crawl data from the web, and how can site owners block the crawler?, Anthropic, actualizada el 07-04-2026.
  7. 7Perplexity Crawlers, Perplexity, consultada el 07-10-2026.
  8. 8Google's common crawlers, Google Search Central, actualizada el 14-07-2026.
  9. 9About Applebot, Apple, actualizada el 04-09-2026.
  10. 10CCBot, Common Crawl, consultada el 07-10-2026.
  11. 11AI features and your website, Google Search Central, actualizada el 10-12-2025.
  12. 12How Google interprets the robots.txt specification, Google Search Central, actualizada el 31-08-2026.
  13. 13How to edit robots.txt through Yoast SEO, Yoast, consultada el 07-10-2026.
  14. 14The /llms.txt file, Jeremy Howard, 03-09-2024.
  15. 15Latest Google Search documentation updates, Google Search Central, actualizada el 01-10-2026.
  16. 16Yoast SEO 25.3 changelog, Yoast, 10-06-2025.
  17. 17How to enable llms.txt with Yoast SEO, Yoast, consultada el 07-10-2026.
  18. 18How to use llms.txt in Rank Math SEO, Rank Math, consultada el 07-10-2026.
  19. 19robots.txt report, Ayuda de Search Console, consultada el 07-10-2026.

Cómo citar este artículo

SmoothSeen. (2026, 7 de octubre). robots.txt en WordPress para rastreadores de IA: qué permitir, qué vetar y llms.txt. https://smoothseen.com/es/blog/wordpress-robots-txt-llms-txt/

Quién lo escribe

SmoothSeen es una herramienta de auditoría web que mide el posicionamiento en buscadores y en asistentes de IA y entrega informes con la marca de la agencia.

Este blog es de SmoothSeen: cuando un artículo habla del producto, lo hace sabiendo que es el nuestro. Las cifras de terceros enlazan a su fuente original.

Historial de cambios

  • Primera versión.

Sigue leyendo

robots.txt en WordPress para bots de IA y llms.txt