Qui sont ces robots ?
Chaque moteur IA envoie ses propres robots (crawlers) lire le web. Ils s'identifient par leur nom d'agent, et votre fichier robots.txt peut les accepter ou les refuser individuellement. Les principaux :
| Robot | Société | Sert à |
|---|---|---|
GPTBot | OpenAI | Alimenter ChatGPT et ses réponses |
OAI-SearchBot | OpenAI | La recherche web de ChatGPT (citations en direct) |
ClaudeBot | Anthropic | Alimenter Claude |
PerplexityBot | Perplexity | Le moteur de réponses Perplexity, qui cite ses sources |
Google-Extended | Gemini et les fonctions IA de Google (distinct de Googlebot) | |
CCBot | Common Crawl | Une archive publique du web utilisée pour entraîner de nombreux modèles |
Point important : Google-Extended ne touche pas votre référencement classique. Le bloquer ne vous retire pas de Google, mais vous retire des réponses générées par ses IA.
Ce qu'un blocage vous coûte
Le débat « faut-il laisser les IA lire mon contenu ? » est légitime pour un média qui vend ses articles. Pour une entreprise dont le site sert à trouver des clients, le calcul est différent : votre site est une vitrine, et un robot bloqué est un canal de recommandation fermé.
- Un prospect demande une recommandation à ChatGPT : si GPTBot n'a jamais pu lire votre site, vos concurrents accessibles seront cités, pas vous.
- Perplexity cite ses sources avec des liens cliquables : un blocage vous retire de ce trafic.
- Les réponses IA en haut de Google (AI Overviews) captent une part croissante des clics : bloquer Google-Extended vous en exclut.
Le piège le plus courant : le blocage involontaire. Certains pare-feu, CDN et réglages d'hébergeur bloquent les crawlers IA par défaut, et un robots.txt contenant User-agent: * suivi de Disallow: / mal placé fait la même chose. Le site paraît normal aux visiteurs, mais il est invisible pour les IA depuis des mois.
Les lignes à mettre dans votre robots.txt
Pour autoriser explicitement les crawlers IA (recommandé pour la plupart des entreprises) :
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Allow: /
User-agent: CCBot
Allow: /
Pour bloquer un robot précis tout en gardant les autres, remplacez son Allow: / par Disallow: /. Le fichier se trouve à la racine de votre site : votresite.fr/robots.txt.
Quand un blocage se défend
Autoriser n'est pas un dogme. Trois cas où bloquer (tout ou partie) est un choix rationnel :
- Contenu payant : si votre valeur est le contenu lui-même (formations, études, articles premium), le donner aux IA peut cannibaliser vos ventes.
- Espaces privés : intranet, espace client, pages de résultats internes. Bloquez ces répertoires précis plutôt que tout le site.
- Position de principe sur l'utilisation de vos contenus pour l'entraînement : dans ce cas, sachez que vous arbitrez de la visibilité contre du contrôle, et faites-le en connaissance de cause.
Comment vérifier votre situation en 30 secondes
Ouvrez votresite.fr/robots.txt et cherchez les noms des robots ci-dessus. Aucune mention = ils héritent de la règle générale User-agent: *. Un Disallow: / sous leur nom = bloqués. Et le robots.txt ne dit pas tout : un blocage au niveau du pare-feu ou du CDN n'y apparaît pas.
Notre audit teste précisément ce point, robot par robot, parmi ses 11 vérifications de visibilité IA. Une fois l'accès ouvert, l'étape suivante est d'aider les IA à vous comprendre : c'est le rôle du llms.txt et, plus largement, des 4 conditions du GEO.