Comprobación de acceso de bots de IA

Dos docenas de rastreadores recogen ahora páginas web para productos de IA. Esta comprobación aplica tu robots.txt a cada uno de ellos, te muestra quién puede entrar y escribe las reglas si quieres cambiar la lista de invitados.

Sirve cualquier dirección de página. La comprobación siempre lee el /robots.txt de ese host.

O prueba nytimes.com, wikipedia.org, github.com

Genera las líneas para tu robots.txt

Marca los tipos de rastreadores que quieres mantener fuera. Las reglas de abajo se reescriben solas con cada cambio; añádelas al final de tu robots.txt. Nada de lo que hay aquí se envía a nuestro servidor.

Tus páginas quedan fuera de los datos usados para construir futuros modelos de IA. La búsqueda de Google y de Bing no se ve afectada.

Elegir rastreadores uno por uno (14)

ChatGPT search, Perplexity, Claude y herramientas similares dejan de citar y enlazar tu sitio.

Elegir rastreadores uno por uno (4)

A un asistente al que una persona le pide abrir una de tus páginas se le dice que no.

Elegir rastreadores uno por uno (6)
robots.txt

Estas líneas no tocan a Googlebot ni a Bingbot, así que tu lugar en los resultados de búsqueda no cambia. ¿Sin acceso a archivos en WordPress? Los complementos de SEO como Yoast y Rank Math incluyen un editor de robots.txt.

Tres trabajos, tres grupos de rastreadores

Cuando un “bot de IA” solicita tu página, está haciendo uno de tres trabajos distintos, y la mayoría de las empresas de IA usan un rastreador aparte para cada uno. Conviene distinguirlos, porque lo que cada uno te cuesta y lo que te devuelve no es lo mismo.

TrabajoQué pasa con tu páginaEjemplos
EntrenamientoEl texto se suma a los datos con los que se construirán futuros modelos. No recibes a cambio ningún enlace ni ninguna visita.GPTBot, ClaudeBot, CCBot, Bytespider, Meta-ExternalAgent, Amazonbot
Búsqueda con IALa página entra en un índice. Cuando un usuario hace una pregunta, el asistente puede citarla y enlazarla como fuente.OAI-SearchBot, Claude-SearchBot, PerplexityBot, DuckAssistBot
Bajo demandaUna persona pegó tu dirección en un asistente, o le pidió que buscara algo, y este descarga esa única página en ese momento.ChatGPT-User, Claude-User, Perplexity-User, MistralAI-User

Dos nombres del grupo de entrenamiento no son rastreadores en absoluto. Google-Extended y Applebot-Extended nunca solicitan nada. Son etiquetas que Googlebot y Applebot consultan en tu robots.txt para saber si las páginas que ya descargan para la búsqueda también pueden usarse para Gemini o Apple Intelligence. Prohibirlos no cambia nada en los resultados de Google Search ni de Siri.

Cómo encuentra un rastreador sus reglas

La comprobación sigue el Protocolo de exclusión de robots (RFC 9309) como lo hace un rastreador bien educado:

  1. Busca un grupo cuya línea User-agent sea exactamente el token del rastreador, sin distinguir mayúsculas de minúsculas. Applebot no cubre a Applebot-Extended.
  2. Si ningún grupo nombra al rastreador, se aplica el grupo User-agent: *. Si no existe, todo está permitido.
  3. Dentro del grupo, gana la ruta coincidente más larga. Cuando un Allow y un Disallow tienen la misma longitud, gana Allow. * coincide con cualquier secuencia de caracteres y $ ancla el final.

Después se prueba cada rastreador con la página de inicio y con la ruta de una página normal:

Permitido
Se pueden leer ambas. Algunas secciones aún pueden estar cerradas, como /wp-admin/ o /cart/, y se enumeran.
Parcial
Una de las dos está cerrada.
Bloqueado
Las dos están cerradas, lo que en la práctica significa Disallow: /.

El estado del propio archivo también cuenta. Un 404 significa que no hay reglas, así que todos los rastreadores pueden leerlo todo. Una página HTML servida en /robots.txt se ignora, con el mismo efecto. El peligroso es un error 5xx. Los rastreadores, Googlebot incluido, lo tratan como “no entres” hasta que el archivo vuelve.

Escribir el bloque

El generador bajo los resultados agrupa los rastreadores por trabajo. Marca un grupo, o ábrelo y elige los nombres uno por uno, y escribe las líneas. Después de una comprobación, las casillas empiezan en el estado en que está hoy tu sitio. Muchos sitios eligen rechazar el entrenamiento y mantener las visitas de búsqueda y bajo demanda:

User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /

Varias líneas User-agent pueden compartir un mismo conjunto de reglas. Añade el bloque al final del archivo existente y deja tu grupo actual User-agent: * como está. El archivo tiene que ser texto plano, servido en la raíz de cada host, así que www.example.com y shop.example.com necesitan cada uno el suyo.

La comprobación también informa de dos señales laterales. Una son las etiquetas meta de robots y los encabezados X-Robots-Tag de la página de inicio (incluido el valor no estándar noai). La otra es si existe un archivo /llms.txt. Ese archivo es un resumen propuesto de un sitio en Markdown para los modelos de lenguaje. No concede nada y no prohíbe nada.

Lo que robots.txt no puede hacer

robots.txt es una petición publicada. OpenAI, Anthropic, Google, Apple, Perplexity y Common Crawl afirman que sus rastreadores la cumplen. Nada técnico obliga a ningún rastreador, y los scrapers que se esconden tras el user agent de un navegador no lo leen. Algunas empresas también dicen que las descargas bajo demanda, como las inicia una persona, pueden no consultarlo.

Bloquear un rastreador de entrenamiento detiene la recogida futura. No elimina las páginas ya recopiladas y no tiene efecto sobre las copias de tu texto que otros sitios hayan republicado.

Para hacer cumplir un rechazo necesitas una regla en el servidor o en el CDN que responda 403 al user agent del rastreador o a sus rangos de IP publicados. Cloudflare, Fastly y la mayoría de los cortafuegos de aplicaciones web ofrecen una regla gestionada para rastreadores de IA.

Preguntas frecuentes

¿Bloquear GPTBot elimina mi sitio de ChatGPT?

No. GPTBot solo recoge datos de entrenamiento. Las citas en la búsqueda de ChatGPT vienen de OAI-SearchBot, y las páginas que un usuario pide a ChatGPT que abra las descarga ChatGPT-User. Cada uno tiene su propia línea en robots.txt.

¿Bloquear rastreadores de IA perjudicará mi posición en Google?

No, siempre que dejes en paz a Googlebot y a Bingbot. Google-Extended es un token aparte que solo controla el uso para Gemini. Ten en cuenta que los AI Overviews de Google Search se producen a partir del índice normal de Googlebot.

¿Cómo bloqueo todos los bots de IA en robots.txt?

Enumera cada token en su propia línea User-agent, seguido de un único Disallow: /. No existe un comodín para “toda la IA”. Marca los tres grupos en el generador de esta página para obtener la lista completa y vuelve de vez en cuando, porque siguen apareciendo rastreadores nuevos.

¿Qué es llms.txt?

Un archivo propuesto en 2024, que se coloca en /llms.txt y describe un sitio en Markdown con enlaces a sus páginas principales. Pretende ayudar a los modelos de lenguaje a encontrar el contenido útil. Pocas herramientas lo leen todavía y no es un control de acceso.

¿De verdad respetan robots.txt las empresas de IA?

Las grandes documentan los tokens de sus rastreadores y dicen que lo cumplen, y los registros del servidor lo confirman en su mayor parte. Los scrapers más pequeños suelen ignorar el archivo o usar un user agent falso. Si necesitas estar seguro, bloquea en el cortafuegos.

¿Por qué aparece como permitido un rastreador que nunca mencioné?

Un rastreador sin grupo propio recurre a User-agent: *. Si ese grupo no prohíbe todo el sitio, el rastreador está permitido. En robots.txt, no decir nada significa sí.