Comprobación de acceso de bots de IA
Dos docenas de rastreadores recogen ahora páginas web para productos de IA. Esta comprobación aplica tu robots.txt a cada uno de ellos, te muestra quién puede entrar y escribe las reglas si quieres cambiar la lista de invitados.
Genera las líneas para tu robots.txt
Marca los tipos de rastreadores que quieres mantener fuera. Las reglas de abajo se reescriben solas con cada cambio; añádelas al final de tu robots.txt. Nada de lo que hay aquí se envía a nuestro servidor.
Estas líneas no tocan a Googlebot ni a Bingbot, así que tu lugar en los resultados de búsqueda no cambia. ¿Sin acceso a archivos en WordPress? Los complementos de SEO como Yoast y Rank Math incluyen un editor de robots.txt.
Tres trabajos, tres grupos de rastreadores
Cuando un “bot de IA” solicita tu página, está haciendo uno de tres trabajos distintos, y la mayoría de las empresas de IA usan un rastreador aparte para cada uno. Conviene distinguirlos, porque lo que cada uno te cuesta y lo que te devuelve no es lo mismo.
| Trabajo | Qué pasa con tu página | Ejemplos |
|---|---|---|
| Entrenamiento | El texto se suma a los datos con los que se construirán futuros modelos. No recibes a cambio ningún enlace ni ninguna visita. | GPTBot, ClaudeBot, CCBot, Bytespider, Meta-ExternalAgent, Amazonbot |
| Búsqueda con IA | La página entra en un índice. Cuando un usuario hace una pregunta, el asistente puede citarla y enlazarla como fuente. | OAI-SearchBot, Claude-SearchBot, PerplexityBot, DuckAssistBot |
| Bajo demanda | Una persona pegó tu dirección en un asistente, o le pidió que buscara algo, y este descarga esa única página en ese momento. | ChatGPT-User, Claude-User, Perplexity-User, MistralAI-User |
Dos nombres del grupo de entrenamiento no son rastreadores en absoluto. Google-Extended y Applebot-Extended nunca solicitan nada. Son etiquetas que Googlebot y Applebot consultan en tu robots.txt para saber si las páginas que ya descargan para la búsqueda también pueden usarse para Gemini o Apple Intelligence. Prohibirlos no cambia nada en los resultados de Google Search ni de Siri.
Cómo encuentra un rastreador sus reglas
La comprobación sigue el Protocolo de exclusión de robots (RFC 9309) como lo hace un rastreador bien educado:
- Busca un grupo cuya línea
User-agentsea exactamente el token del rastreador, sin distinguir mayúsculas de minúsculas.Applebotno cubre aApplebot-Extended. - Si ningún grupo nombra al rastreador, se aplica el grupo
User-agent: *. Si no existe, todo está permitido. - Dentro del grupo, gana la ruta coincidente más larga. Cuando un
Allowy unDisallowtienen la misma longitud, ganaAllow.*coincide con cualquier secuencia de caracteres y$ancla el final.
Después se prueba cada rastreador con la página de inicio y con la ruta de una página normal:
- Permitido
- Se pueden leer ambas. Algunas secciones aún pueden estar cerradas, como
/wp-admin/o/cart/, y se enumeran. - Parcial
- Una de las dos está cerrada.
- Bloqueado
- Las dos están cerradas, lo que en la práctica significa
Disallow: /.
El estado del propio archivo también cuenta. Un 404 significa que no hay reglas, así que todos los rastreadores pueden leerlo todo. Una página HTML servida en /robots.txt se ignora, con el mismo efecto. El peligroso es un error 5xx. Los rastreadores, Googlebot incluido, lo tratan como “no entres” hasta que el archivo vuelve.
Escribir el bloque
El generador bajo los resultados agrupa los rastreadores por trabajo. Marca un grupo, o ábrelo y elige los nombres uno por uno, y escribe las líneas. Después de una comprobación, las casillas empiezan en el estado en que está hoy tu sitio. Muchos sitios eligen rechazar el entrenamiento y mantener las visitas de búsqueda y bajo demanda:
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /Varias líneas User-agent pueden compartir un mismo conjunto de reglas. Añade el bloque al final del archivo existente y deja tu grupo actual User-agent: * como está. El archivo tiene que ser texto plano, servido en la raíz de cada host, así que www.example.com y shop.example.com necesitan cada uno el suyo.
La comprobación también informa de dos señales laterales. Una son las etiquetas meta de robots y los encabezados X-Robots-Tag de la página de inicio (incluido el valor no estándar noai). La otra es si existe un archivo /llms.txt. Ese archivo es un resumen propuesto de un sitio en Markdown para los modelos de lenguaje. No concede nada y no prohíbe nada.
Lo que robots.txt no puede hacer
robots.txt es una petición publicada. OpenAI, Anthropic, Google, Apple, Perplexity y Common Crawl afirman que sus rastreadores la cumplen. Nada técnico obliga a ningún rastreador, y los scrapers que se esconden tras el user agent de un navegador no lo leen. Algunas empresas también dicen que las descargas bajo demanda, como las inicia una persona, pueden no consultarlo.
Bloquear un rastreador de entrenamiento detiene la recogida futura. No elimina las páginas ya recopiladas y no tiene efecto sobre las copias de tu texto que otros sitios hayan republicado.
Para hacer cumplir un rechazo necesitas una regla en el servidor o en el CDN que responda 403 al user agent del rastreador o a sus rangos de IP publicados. Cloudflare, Fastly y la mayoría de los cortafuegos de aplicaciones web ofrecen una regla gestionada para rastreadores de IA.
Preguntas frecuentes
¿Bloquear GPTBot elimina mi sitio de ChatGPT?
No. GPTBot solo recoge datos de entrenamiento. Las citas en la búsqueda de ChatGPT vienen de OAI-SearchBot, y las páginas que un usuario pide a ChatGPT que abra las descarga ChatGPT-User. Cada uno tiene su propia línea en robots.txt.
¿Bloquear rastreadores de IA perjudicará mi posición en Google?
No, siempre que dejes en paz a Googlebot y a Bingbot. Google-Extended es un token aparte que solo controla el uso para Gemini. Ten en cuenta que los AI Overviews de Google Search se producen a partir del índice normal de Googlebot.
¿Cómo bloqueo todos los bots de IA en robots.txt?
Enumera cada token en su propia línea User-agent, seguido de un único Disallow: /. No existe un comodín para “toda la IA”. Marca los tres grupos en el generador de esta página para obtener la lista completa y vuelve de vez en cuando, porque siguen apareciendo rastreadores nuevos.
¿Qué es llms.txt?
Un archivo propuesto en 2024, que se coloca en /llms.txt y describe un sitio en Markdown con enlaces a sus páginas principales. Pretende ayudar a los modelos de lenguaje a encontrar el contenido útil. Pocas herramientas lo leen todavía y no es un control de acceso.
¿De verdad respetan robots.txt las empresas de IA?
Las grandes documentan los tokens de sus rastreadores y dicen que lo cumplen, y los registros del servidor lo confirman en su mayor parte. Los scrapers más pequeños suelen ignorar el archivo o usar un user agent falso. Si necesitas estar seguro, bloquea en el cortafuegos.
¿Por qué aparece como permitido un rastreador que nunca mencioné?
Un rastreador sin grupo propio recurre a User-agent: *. Si ese grupo no prohíbe todo el sitio, el rastreador está permitido. En robots.txt, no decir nada significa sí.