Votre site est-il accessible à Googlebot, à Bingbot, et aux robots de ChatGPT, Claude, Perplexity ou Mistral ? Cet outil lit votre robots.txt et donne son verdict pour 21 robots des moteurs de recherche et des IA. Puis il demande réellement la page sous le nom de chaque robot, pour détecter le pare-feu ou le CDN (Cloudflare, DataDome…) qui les refuse alors que le robots.txt les autorise.
Testez une page
Les robots testés, au 27/09/2026
Quatre familles de robots lisent aujourd'hui vos pages. Les confondre fait prendre de mauvaises décisions : bloquer « les IA » en bloquant Googlebot, c'est aussi disparaître de Google.
- Moteur de recherche Explore le web pour l'index d'un moteur. Ces index alimentent aussi les réponses des IA des mêmes éditeurs.
- Recherche IA Construit l'index dans lequel un assistant IA cherche les pages qu'il cite dans ses réponses.
- Entraînement IA Collecte des pages pour entraîner des modèles de langage. Le bloquer n'empêche pas d'être cité.
- Visite à la demande Va chercher une page au moment où un utilisateur de l'assistant la demande ou la lui fait lire.
| Robot | À quoi il sert | Si vous le bloquez |
|---|---|---|
| Googlebot Moteur de recherche robots.txt : User-agent: Googlebot | Index de Google, qui sert aussi à AI Overviews et à AI Mode. Authentifiable : plages d'IP publiées (common-crawlers.json) et DNS inverse en googlebot.com Documentation de l'éditeur | Les pages sortent de Google, et donc d'AI Overviews et d'AI Mode. |
| Google-Extended Entraînement IA robots.txt : User-agent: Google-Extended | Jeton du robots.txt seulement : les pages sont lues par Googlebot, ce jeton dit si Google peut s'en servir pour ses modèles Gemini. Documentation de l'éditeur | Les pages ne servent plus à entraîner Gemini ni à ancrer ses réponses (applications Gemini, Vertex AI). Aucun effet sur Google Search, AI Overviews et AI Mode compris. |
| Microsoft | ||
| Bingbot Moteur de recherche robots.txt : User-agent: bingbot | Index de Bing, repris par DuckDuckGo, Ecosia et Copilot. Authentifiable : plages d'IP publiées (bingbot.json) et DNS inverse en search.msn.com Documentation de l'éditeur | Les pages sortent de Bing et des moteurs qui s'appuient sur son index, dont Copilot. |
| Apple | ||
| Applebot Moteur de recherche robots.txt : User-agent: Applebot | Recherche de Siri, Spotlight et Safari. Authentifiable : plages d'IP publiées (applebot.json) et DNS inverse en applebot.apple.com Documentation de l'éditeur | Les pages disparaissent des suggestions de Siri, Spotlight et Safari. |
| Applebot-Extended Entraînement IA robots.txt : User-agent: Applebot-Extended | Jeton du robots.txt seulement : les pages sont lues par Applebot, ce jeton dit si Apple peut s'en servir pour ses modèles. Documentation de l'éditeur | Apple n'utilise plus les pages pour entraîner ses modèles. Aucun effet sur Siri, Spotlight ni Safari. |
| OpenAI | ||
| OAI-SearchBot Recherche IA robots.txt : User-agent: OAI-SearchBot | Index de la recherche de ChatGPT. Authentifiable : plages d'IP publiées (searchbot.json) Documentation de l'éditeur | Les pages n'apparaissent plus dans les résultats de recherche de ChatGPT. |
| GPTBot Entraînement IA robots.txt : User-agent: GPTBot | Collecte pour l'entraînement des modèles d'OpenAI. Authentifiable : plages d'IP publiées (gptbot.json) Documentation de l'éditeur | Les pages ne servent plus à entraîner les modèles d'OpenAI. Aucun effet sur la recherche de ChatGPT. |
| ChatGPT-User Visite à la demande robots.txt : User-agent: ChatGPT-User | Visite d'une page à la demande d'un utilisateur de ChatGPT. Authentifiable : plages d'IP publiées (chatgpt-user.json) Peut ne pas appliquer le robots.txt, d'après son éditeur. Documentation de l'éditeur | ChatGPT ne peut plus lire la page quand un utilisateur la lui demande. |
| Anthropic | ||
| Claude-SearchBot Recherche IA robots.txt : User-agent: Claude-SearchBot | Index de la recherche de Claude. Authentifiable : plages d'IP publiées (bots.json, commun aux robots d'Anthropic) Documentation de l'éditeur | Les pages risquent de moins apparaître dans les réponses de Claude qui s'appuient sur la recherche. |
| ClaudeBot Entraînement IA robots.txt : User-agent: ClaudeBot | Collecte pour l'entraînement des modèles d'Anthropic. Authentifiable : plages d'IP publiées (bots.json, commun aux robots d'Anthropic) Documentation de l'éditeur | Les pages ne servent plus à entraîner les modèles d'Anthropic. |
| Claude-User Visite à la demande robots.txt : User-agent: Claude-User | Visite d'une page à la demande d'un utilisateur de Claude. Authentifiable : plages d'IP publiées (bots.json, commun aux robots d'Anthropic) Documentation de l'éditeur | Claude ne peut plus lire la page quand un utilisateur la lui demande. |
| Perplexity | ||
| PerplexityBot Recherche IA robots.txt : User-agent: PerplexityBot | Index de la recherche de Perplexity. Authentifiable : plages d'IP publiées (perplexitybot.json) Documentation de l'éditeur | Les pages n'apparaissent plus dans les résultats de Perplexity. |
| Perplexity-User Visite à la demande robots.txt : User-agent: Perplexity-User | Visite d'une page à la demande d'un utilisateur de Perplexity. Authentifiable : plages d'IP publiées (perplexity-user.json) Peut ne pas appliquer le robots.txt, d'après son éditeur. Documentation de l'éditeur | Perplexity ne peut plus lire la page quand un utilisateur la lui demande. |
| Mistral AI | ||
| MistralAI-User Visite à la demande robots.txt : User-agent: MistralAI-User | Visite d'une page à la demande d'un utilisateur des assistants de Mistral AI. Ni exploration automatique, ni entraînement. Authentifiable : plages d'IP publiées (mistralai-user-ips.json) Documentation de l'éditeur | Les assistants de Mistral AI ne peuvent plus lire la page quand un utilisateur la leur demande. |
| Meta | ||
| Meta-ExternalAgent Entraînement IA robots.txt : User-agent: meta-externalagent | Collecte pour l'entraînement des modèles de Meta (Llama). Documentation de l'éditeur | Les pages ne servent plus à entraîner les modèles de Meta. Meta annonce qu'il respecte le robots.txt. Sur WebRankInfo, en septembre 2026, il a pourtant continué à visiter des pages interdites par un Disallow : nous le bloquons désormais par une erreur 403. |
| Meta-ExternalFetcher Visite à la demande robots.txt : User-agent: meta-externalfetcher | Visite d'une page à la demande d'un utilisateur des assistants de Meta. Peut ne pas appliquer le robots.txt, d'après son éditeur. Documentation de l'éditeur | Meta AI ne peut plus lire la page quand un utilisateur la lui demande. |
| Amazon | ||
| Amazonbot Entraînement IA robots.txt : User-agent: Amazonbot | Services d'Amazon ; les pages peuvent aussi servir à entraîner ses modèles. La recherche et Alexa passent par un autre robot, Amzn-SearchBot. Authentifiable : plages d'IP publiées (developer.amazon.com/amazonbot/ip-addresses) Documentation de l'éditeur | Les pages ne servent plus aux services ni aux modèles d'Amazon. |
| ByteDance | ||
| Bytespider Entraînement IA robots.txt : User-agent: Bytespider | Collecte pour les modèles de ByteDance (TikTok, Doubao). | Les pages ne servent plus aux modèles de ByteDance, si le robot applique la règle. |
| Common Crawl | ||
| CCBot Entraînement IA robots.txt : User-agent: CCBot | Corpus ouvert de Common Crawl, réutilisé pour entraîner la plupart des modèles. Authentifiable : plages d'IP publiées (ccbot.json) et DNS inverse en crawl.commoncrawl.org Documentation de l'éditeur | Les pages sortent des prochaines archives de Common Crawl, donc des corpus qui en dérivent. |
| DuckDuckGo | ||
| DuckDuckBot Moteur de recherche robots.txt : User-agent: DuckDuckBot | Robot propre de DuckDuckGo, en complément de l'index de Bing. Authentifiable : plages d'IP publiées (duckduckbot.json) Documentation de l'éditeur | Peu d'effet tant que Bingbot passe : DuckDuckGo s'appuie surtout sur l'index de Bing. |
| Qwant | ||
| Qwantbot Moteur de recherche robots.txt : User-agent: Qwantbot | Index de Qwant. Authentifiable : DNS inverse en qwant.com Documentation de l'éditeur | Les pages sortent de l'index propre de Qwant. |
Bloquer l'entraînement des IA sans perdre sa visibilité
C'est la demande la plus fréquente. Elle se règle dans le robots.txt, en ne visant que les robots d'entraînement :
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: CCBot
User-agent: Bytespider
User-agent: Amazonbot
Disallow: /
Googlebot, Bingbot et Applebot continuent d'explorer le site, et avec eux AI Overviews, AI Mode et Copilot. OAI-SearchBot, Claude-SearchBot et PerplexityBot aussi : vos pages restent citables dans ChatGPT, Claude et Perplexity. Deux limites à connaître : un robot peu scrupuleux peut ignorer le robots.txt, et seul un refus au niveau du serveur l'arrête alors. Et Google-Extended ne retire pas vos pages d'AI Overviews, qui font partie de Google Search.
Questions-réponses
- Pourquoi mes règles pour tous les robots ne s'appliquent-elles plus à Googlebot ? Un robot suit le groupe qui le nomme, et seulement lui. Dès que le robots.txt contient un groupe
User-agent: Googlebot, Googlebot ignore tout le groupeUser-agent: *. Il faut recopier dans son groupe les règles communes qu'il doit continuer à suivre. - Le robots.txt autorise un robot, mais l'outil dit que le serveur le refuse. Qui a raison ? Les deux. Le robots.txt exprime une permission ; le pare-feu, le CDN ou l'hébergeur décident de ce qui passe vraiment. Certaines protections anti-robots bloquent les robots des IA par défaut, sans que le propriétaire du site le sache.
- L'outil signale un refus pour Googlebot. Suis-je bloqué ? Pas forcément. Google publie les adresses IP de ses robots, et de nombreux pare-feux refusent tout ce qui se présente comme Googlebot sans venir de ces adresses. Notre requête en fait partie. Regardez les statistiques d'exploration de la Search Console, ou vos logs : si Googlebot y apparaît, il passe.
- Quelle différence entre OAI-SearchBot, GPTBot et ChatGPT-User ? OAI-SearchBot construit l'index de la recherche de ChatGPT, GPTBot collecte pour l'entraînement des modèles, ChatGPT-User va lire une page quand un utilisateur la demande. On peut bloquer le deuxième et garder les deux autres.
- Un fichier llms.txt remplace-t-il le robots.txt ? Non. Le robots.txt dit ce que les robots peuvent explorer ; un llms.txt propose un résumé du site aux IA, sans rien autoriser ni interdire.
Rappel : les principaux outils
Voici les outils les plus souvent utilisés pour travailler son référencement :