Robots IA et moteurs de recherche : votre site leur est-il accessible ?

Votre site est-il accessible à Googlebot, à Bingbot, et aux robots de ChatGPT, Claude, Perplexity ou Mistral ? Cet outil lit votre robots.txt et donne son verdict pour 21 robots des moteurs de recherche et des IA. Puis il demande réellement la page sous le nom de chaque robot, pour détecter le pare-feu ou le CDN (Cloudflare, DataDome…) qui les refuse alors que le robots.txt les autorise.

Testez une page

La page d'accueil de votre site, ou n'importe quelle page : le robots.txt s'applique page par page. Comptez quelques secondes.

Les robots testés, au 27/09/2026

Quatre familles de robots lisent aujourd'hui vos pages. Les confondre fait prendre de mauvaises décisions : bloquer « les IA » en bloquant Googlebot, c'est aussi disparaître de Google.

  • Moteur de recherche Explore le web pour l'index d'un moteur. Ces index alimentent aussi les réponses des IA des mêmes éditeurs.
  • Recherche IA Construit l'index dans lequel un assistant IA cherche les pages qu'il cite dans ses réponses.
  • Entraînement IA Collecte des pages pour entraîner des modèles de langage. Le bloquer n'empêche pas d'être cité.
  • Visite à la demande Va chercher une page au moment où un utilisateur de l'assistant la demande ou la lui fait lire.
RobotÀ quoi il sertSi vous le bloquez
Google
Googlebot Moteur de recherche
robots.txt : User-agent: Googlebot
Index de Google, qui sert aussi à AI Overviews et à AI Mode.
Authentifiable : plages d'IP publiées (common-crawlers.json) et DNS inverse en googlebot.com
Documentation de l'éditeur
Les pages sortent de Google, et donc d'AI Overviews et d'AI Mode.
Google-Extended Entraînement IA
robots.txt : User-agent: Google-Extended
Jeton du robots.txt seulement : les pages sont lues par Googlebot, ce jeton dit si Google peut s'en servir pour ses modèles Gemini.
Documentation de l'éditeur
Les pages ne servent plus à entraîner Gemini ni à ancrer ses réponses (applications Gemini, Vertex AI). Aucun effet sur Google Search, AI Overviews et AI Mode compris.
Microsoft
Bingbot Moteur de recherche
robots.txt : User-agent: bingbot
Index de Bing, repris par DuckDuckGo, Ecosia et Copilot.
Authentifiable : plages d'IP publiées (bingbot.json) et DNS inverse en search.msn.com
Documentation de l'éditeur
Les pages sortent de Bing et des moteurs qui s'appuient sur son index, dont Copilot.
Apple
Applebot Moteur de recherche
robots.txt : User-agent: Applebot
Recherche de Siri, Spotlight et Safari.
Authentifiable : plages d'IP publiées (applebot.json) et DNS inverse en applebot.apple.com
Documentation de l'éditeur
Les pages disparaissent des suggestions de Siri, Spotlight et Safari.
Applebot-Extended Entraînement IA
robots.txt : User-agent: Applebot-Extended
Jeton du robots.txt seulement : les pages sont lues par Applebot, ce jeton dit si Apple peut s'en servir pour ses modèles.
Documentation de l'éditeur
Apple n'utilise plus les pages pour entraîner ses modèles. Aucun effet sur Siri, Spotlight ni Safari.
OpenAI
OAI-SearchBot Recherche IA
robots.txt : User-agent: OAI-SearchBot
Index de la recherche de ChatGPT.
Authentifiable : plages d'IP publiées (searchbot.json)
Documentation de l'éditeur
Les pages n'apparaissent plus dans les résultats de recherche de ChatGPT.
GPTBot Entraînement IA
robots.txt : User-agent: GPTBot
Collecte pour l'entraînement des modèles d'OpenAI.
Authentifiable : plages d'IP publiées (gptbot.json)
Documentation de l'éditeur
Les pages ne servent plus à entraîner les modèles d'OpenAI. Aucun effet sur la recherche de ChatGPT.
ChatGPT-User Visite à la demande
robots.txt : User-agent: ChatGPT-User
Visite d'une page à la demande d'un utilisateur de ChatGPT.
Authentifiable : plages d'IP publiées (chatgpt-user.json)
Peut ne pas appliquer le robots.txt, d'après son éditeur.
Documentation de l'éditeur
ChatGPT ne peut plus lire la page quand un utilisateur la lui demande.
Anthropic
Claude-SearchBot Recherche IA
robots.txt : User-agent: Claude-SearchBot
Index de la recherche de Claude.
Authentifiable : plages d'IP publiées (bots.json, commun aux robots d'Anthropic)
Documentation de l'éditeur
Les pages risquent de moins apparaître dans les réponses de Claude qui s'appuient sur la recherche.
ClaudeBot Entraînement IA
robots.txt : User-agent: ClaudeBot
Collecte pour l'entraînement des modèles d'Anthropic.
Authentifiable : plages d'IP publiées (bots.json, commun aux robots d'Anthropic)
Documentation de l'éditeur
Les pages ne servent plus à entraîner les modèles d'Anthropic.
Claude-User Visite à la demande
robots.txt : User-agent: Claude-User
Visite d'une page à la demande d'un utilisateur de Claude.
Authentifiable : plages d'IP publiées (bots.json, commun aux robots d'Anthropic)
Documentation de l'éditeur
Claude ne peut plus lire la page quand un utilisateur la lui demande.
Perplexity
PerplexityBot Recherche IA
robots.txt : User-agent: PerplexityBot
Index de la recherche de Perplexity.
Authentifiable : plages d'IP publiées (perplexitybot.json)
Documentation de l'éditeur
Les pages n'apparaissent plus dans les résultats de Perplexity.
Perplexity-User Visite à la demande
robots.txt : User-agent: Perplexity-User
Visite d'une page à la demande d'un utilisateur de Perplexity.
Authentifiable : plages d'IP publiées (perplexity-user.json)
Peut ne pas appliquer le robots.txt, d'après son éditeur.
Documentation de l'éditeur
Perplexity ne peut plus lire la page quand un utilisateur la lui demande.
Mistral AI
MistralAI-User Visite à la demande
robots.txt : User-agent: MistralAI-User
Visite d'une page à la demande d'un utilisateur des assistants de Mistral AI. Ni exploration automatique, ni entraînement.
Authentifiable : plages d'IP publiées (mistralai-user-ips.json)
Documentation de l'éditeur
Les assistants de Mistral AI ne peuvent plus lire la page quand un utilisateur la leur demande.
Meta
Meta-ExternalAgent Entraînement IA
robots.txt : User-agent: meta-externalagent
Collecte pour l'entraînement des modèles de Meta (Llama).
Documentation de l'éditeur
Les pages ne servent plus à entraîner les modèles de Meta.
Meta annonce qu'il respecte le robots.txt. Sur WebRankInfo, en septembre 2026, il a pourtant continué à visiter des pages interdites par un Disallow : nous le bloquons désormais par une erreur 403.
Meta-ExternalFetcher Visite à la demande
robots.txt : User-agent: meta-externalfetcher
Visite d'une page à la demande d'un utilisateur des assistants de Meta.
Peut ne pas appliquer le robots.txt, d'après son éditeur.
Documentation de l'éditeur
Meta AI ne peut plus lire la page quand un utilisateur la lui demande.
Amazon
Amazonbot Entraînement IA
robots.txt : User-agent: Amazonbot
Services d'Amazon ; les pages peuvent aussi servir à entraîner ses modèles. La recherche et Alexa passent par un autre robot, Amzn-SearchBot.
Authentifiable : plages d'IP publiées (developer.amazon.com/amazonbot/ip-addresses)
Documentation de l'éditeur
Les pages ne servent plus aux services ni aux modèles d'Amazon.
ByteDance
Bytespider Entraînement IA
robots.txt : User-agent: Bytespider
Collecte pour les modèles de ByteDance (TikTok, Doubao).Les pages ne servent plus aux modèles de ByteDance, si le robot applique la règle.
Common Crawl
CCBot Entraînement IA
robots.txt : User-agent: CCBot
Corpus ouvert de Common Crawl, réutilisé pour entraîner la plupart des modèles.
Authentifiable : plages d'IP publiées (ccbot.json) et DNS inverse en crawl.commoncrawl.org
Documentation de l'éditeur
Les pages sortent des prochaines archives de Common Crawl, donc des corpus qui en dérivent.
DuckDuckGo
DuckDuckBot Moteur de recherche
robots.txt : User-agent: DuckDuckBot
Robot propre de DuckDuckGo, en complément de l'index de Bing.
Authentifiable : plages d'IP publiées (duckduckbot.json)
Documentation de l'éditeur
Peu d'effet tant que Bingbot passe : DuckDuckGo s'appuie surtout sur l'index de Bing.
Qwant
Qwantbot Moteur de recherche
robots.txt : User-agent: Qwantbot
Index de Qwant.
Authentifiable : DNS inverse en qwant.com
Documentation de l'éditeur
Les pages sortent de l'index propre de Qwant.

Bloquer l'entraînement des IA sans perdre sa visibilité

C'est la demande la plus fréquente. Elle se règle dans le robots.txt, en ne visant que les robots d'entraînement :

User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: CCBot
User-agent: Bytespider
User-agent: Amazonbot
Disallow: /

Googlebot, Bingbot et Applebot continuent d'explorer le site, et avec eux AI Overviews, AI Mode et Copilot. OAI-SearchBot, Claude-SearchBot et PerplexityBot aussi : vos pages restent citables dans ChatGPT, Claude et Perplexity. Deux limites à connaître : un robot peu scrupuleux peut ignorer le robots.txt, et seul un refus au niveau du serveur l'arrête alors. Et Google-Extended ne retire pas vos pages d'AI Overviews, qui font partie de Google Search.

Questions-réponses

  • Pourquoi mes règles pour tous les robots ne s'appliquent-elles plus à Googlebot ? Un robot suit le groupe qui le nomme, et seulement lui. Dès que le robots.txt contient un groupe User-agent: Googlebot, Googlebot ignore tout le groupe User-agent: *. Il faut recopier dans son groupe les règles communes qu'il doit continuer à suivre.
  • Le robots.txt autorise un robot, mais l'outil dit que le serveur le refuse. Qui a raison ? Les deux. Le robots.txt exprime une permission ; le pare-feu, le CDN ou l'hébergeur décident de ce qui passe vraiment. Certaines protections anti-robots bloquent les robots des IA par défaut, sans que le propriétaire du site le sache.
  • L'outil signale un refus pour Googlebot. Suis-je bloqué ? Pas forcément. Google publie les adresses IP de ses robots, et de nombreux pare-feux refusent tout ce qui se présente comme Googlebot sans venir de ces adresses. Notre requête en fait partie. Regardez les statistiques d'exploration de la Search Console, ou vos logs : si Googlebot y apparaît, il passe.
  • Quelle différence entre OAI-SearchBot, GPTBot et ChatGPT-User ? OAI-SearchBot construit l'index de la recherche de ChatGPT, GPTBot collecte pour l'entraînement des modèles, ChatGPT-User va lire une page quand un utilisateur la demande. On peut bloquer le deuxième et garder les deux autres.
  • Un fichier llms.txt remplace-t-il le robots.txt ? Non. Le robots.txt dit ce que les robots peuvent explorer ; un llms.txt propose un résumé du site aux IA, sans rien autoriser ni interdire.

Rappel : les principaux outils

Voici les outils les plus souvent utilisés pour travailler son référencement :