Vérification de l’accès des robots IA
Deux douzaines de robots collectent désormais des pages web pour des produits d’IA. Cette vérification applique votre robots.txt à chacun d’eux, montre qui a le droit d’entrer et écrit les règles si vous voulez changer la liste d’invités.
Construire les lignes de votre robots.txt
Cochez les types de robots que vous voulez tenir à l’écart. Les règles ci-dessous se réécrivent à chaque changement ; ajoutez-les au bas de votre robots.txt. Rien ici n’est envoyé à notre serveur.
Ces lignes laissent Googlebot et Bingbot tranquilles : votre place dans les résultats de recherche ne bouge donc pas. Pas d’accès aux fichiers sur WordPress ? Des extensions SEO comme Yoast et Rank Math incluent un éditeur de robots.txt.
Trois tâches, trois familles de robots
Quand un « robot IA » demande votre page, il fait l’une de trois tâches différentes et la plupart des entreprises d’IA exploitent un robot distinct pour chacune. Il vaut la peine de les distinguer, car ce que chacun vous coûte et ce qu’il vous rapporte ne sont pas pareils.
| Tâche | Ce qui arrive à votre page | Exemples |
|---|---|---|
| Entraînement | Le texte est ajouté aux données qui servent à construire les futurs modèles. Vous n’obtenez en retour ni lien ni visite. | GPTBot, ClaudeBot, CCBot, Bytespider, Meta-ExternalAgent, Amazonbot |
| Recherche IA | La page entre dans un index. Quand un utilisateur pose une question, l’assistant peut la citer et la lier comme source. | OAI-SearchBot, Claude-SearchBot, PerplexityBot, DuckAssistBot |
| À la demande | Une personne a collé votre adresse dans un assistant, ou lui a demandé de chercher quelque chose et il va chercher cette seule page sur le moment. | ChatGPT-User, Claude-User, Perplexity-User, MistralAI-User |
Deux noms du groupe entraînement ne sont pas des robots du tout. Google-Extended et Applebot-Extended ne demandent jamais rien. Ce sont des étiquettes que Googlebot et Applebot cherchent dans votre robots.txt pour savoir si les pages qu’ils récupèrent déjà pour la recherche peuvent aussi servir à Gemini ou à Apple Intelligence. Les interdire ne change rien aux résultats de Google Search ou de Siri.
Comment un robot trouve ses règles
La vérification suit le protocole d’exclusion des robots (RFC 9309) comme le fait un robot bien élevé :
- Elle cherche un groupe dont la ligne
User-agentest exactement le jeton du robot, sans tenir compte des majuscules et des minuscules.Applebotne couvre pasApplebot-Extended. - Si aucun groupe ne nomme le robot, le groupe
User-agent: *s’applique. S’il n’y en a pas, tout est permis. - Dans le groupe, le chemin correspondant le plus long l’emporte. Quand un
Allowet unDisallowont la même longueur,Allowl’emporte.*correspond à n’importe quelle suite de caractères et$marque la fin.
Chaque robot est ensuite testé sur la page d’accueil et sur un chemin de page ordinaire :
- Autorisé
- Les deux peuvent être lus. Certaines sections peuvent rester fermées, comme
/wp-admin/ou/cart/et elles sont listées. - Partiel
- L’un des deux est fermé.
- Bloqué
- Les deux sont fermés, ce qui en pratique veut dire
Disallow: /.
L’état du fichier lui-même compte aussi. Un 404 signifie aucune règle, donc chaque robot peut tout lire. Une page HTML servie à l’adresse /robots.txt est ignorée, avec le même effet. Le cas dangereux est l’erreur 5xx. Les robots, Googlebot compris, la traitent comme « restez dehors » jusqu’au retour du fichier.
Écrire le bloc
Le générateur sous les résultats regroupe les robots par tâche. Cochez un groupe, ou ouvrez-le et choisissez les noms un par un : il écrit les lignes. Après une vérification, les cases démarrent dans l’état où se trouve votre site aujourd’hui. Beaucoup de sites choisissent de refuser l’entraînement et de garder les visites de recherche et à la demande :
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /Plusieurs lignes User-agent peuvent partager un même ensemble de règles. Ajoutez le bloc à la fin du fichier existant et laissez votre groupe User-agent: * actuel tel quel. Le fichier doit être du texte brut, servi à la racine de chaque hôte : www.example.com et shop.example.com ont donc chacun le leur.
La vérification signale aussi deux signaux annexes. Le premier, ce sont les balises meta robots et les en-têtes X-Robots-Tag de la page d’accueil (y compris la valeur non standard noai). Le second, c’est l’existence d’un fichier /llms.txt. Ce fichier est un résumé proposé d’un site, en Markdown, à l’intention des modèles de langage. Il n’accorde rien et n’interdit rien.
Ce que robots.txt ne peut pas faire
Le robots.txt est une demande publiée. OpenAI, Anthropic, Google, Apple, Perplexity et Common Crawl affirment que leurs robots la respectent. Rien de technique n’y oblige un robot et les aspirateurs de contenu qui se cachent derrière un agent utilisateur de navigateur ne le lisent pas. Certaines entreprises disent aussi que les récupérations à la demande, puisqu’une personne les déclenche, peuvent ne pas le consulter.
Bloquer un robot d’entraînement arrête la collecte future. Cela ne retire pas les pages déjà rassemblées et n’a aucun effet sur les copies de votre texte que d’autres sites ont republiées.
Pour faire respecter un refus, il faut une règle au niveau du serveur ou du CDN qui répond 403 à l’agent utilisateur du robot ou à ses plages d’adresses IP publiées. Cloudflare, Fastly et la plupart des pare-feu d’applications web offrent une règle gérée pour les robots IA.
Questions fréquentes
Bloquer GPTBot retire-t-il mon site de ChatGPT ?
Non. GPTBot ne collecte que des données d’entraînement. Les citations de la recherche ChatGPT viennent de OAI-SearchBot et les pages qu’un utilisateur demande à ChatGPT d’ouvrir sont récupérées par ChatGPT-User. Chacun a sa propre ligne dans le robots.txt.
Bloquer les robots IA nuira-t-il à mon classement Google ?
Non, tant que vous laissez Googlebot et Bingbot tranquilles. Google-Extended est un jeton distinct qui contrôle seulement l’utilisation pour Gemini. Gardez à l’esprit que les AI Overviews de Google Search sont produits à partir de l’index ordinaire de Googlebot.
Comment bloquer tous les robots IA dans le robots.txt ?
Listez chaque jeton sur sa propre ligne User-agent, suivie d’un seul Disallow: /. Il n’existe pas de joker pour « toute l’IA ». Cochez les trois groupes dans le générateur de cette page pour obtenir la liste complète et revenez de temps en temps, car de nouveaux robots apparaissent sans cesse.
Qu’est-ce que llms.txt ?
Un fichier proposé en 2024, placé à l’adresse /llms.txt, qui décrit un site en Markdown avec des liens vers ses pages principales. Il est censé aider les modèles de langage à trouver le contenu utile. Peu d’outils le lisent encore et ce n’est pas un contrôle d’accès.
Les entreprises d’IA respectent-elles vraiment le robots.txt ?
Les grandes documentent leurs jetons de robots et disent s’y conformer et les journaux de serveur le confirment pour la plupart. Les petits aspirateurs de contenu ignorent souvent le fichier ou utilisent un faux agent utilisateur. Si vous avez besoin d’être sûr, bloquez au niveau du pare-feu.
Pourquoi un robot est-il affiché comme autorisé alors que je ne l’ai jamais mentionné ?
Un robot sans groupe à son nom se rabat sur User-agent: *. Si ce groupe n’interdit pas tout le site, le robot est autorisé. Dans un robots.txt, ne rien dire veut dire oui.