Les 3 types de crawlers IA
Avant de bloquer quoi que ce soit, il faut distinguer le rôle de chaque robot. La plupart des éditeurs d'IA en ont désormais plusieurs, et bloquer le mauvais n'a pas du tout le même effet :
- entraînement : le robot collecte des pages pour entraîner les futurs modèles. Le bloquer ne vous retire pas des réponses actuelles, mais les modèles suivants connaîtront moins bien votre site "de mémoire" (exemples : GPTBot, ClaudeBot, meta-externalagent)
- recherche : le robot construit l'index dans lequel l'assistant va chercher ses sources, et c'est lui qui permet d'être cité avec un lien. Le bloquer, c'est disparaître des réponses sourcées (exemples : OAI-SearchBot, Claude-SearchBot, PerplexityBot, meta-webindexer)
- requête d'un utilisateur : le robot va chercher une page précise parce qu'un utilisateur la demande, en direct. Plusieurs éditeurs indiquent que ces robots peuvent ignorer le fichier robots.txt, puisque c'est un humain qui a fait la demande (exemples : ChatGPT-User, Perplexity-User, Google-Agent)
Autrement dit, on peut très bien refuser l'entraînement tout en restant visible dans ChatGPT, Claude ou Perplexity : il suffit de bloquer les robots d'entraînement et de laisser passer ceux de recherche.
Pour voir ce que votre site laisse réellement passer, robot par robot, testez-le avec mon outil d'accès des robots IA.
Liste des crawlers IA
| Nom | Description |
|---|---|
| AI2Bot Propriétaire : Allen Institute for AI Type : entraînement | Collecte des pages pour entraîner les modèles de langage ouverts de l'Allen Institute. User-Agent : Mozilla/5.0 (compatible) AI2Bot (+https://www.allenai.org/crawler) |
| Amazonbot Propriétaire : Amazon Type : entraînement et produits Amazon | Sert à améliorer les produits et services d'Amazon, et d'après Amazon, peut être utilisé pour entraîner ses modèles d'IA. Respecte robots.txt (qu'il garde en cache jusqu'à 30 jours), mais pas Crawl-delay. User-Agent : Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Amazonbot/0.1) Chrome/W.X.Y.Z Safari/537.36 IP publiées : liste Amazon |
| Amzn-SearchBot Propriétaire : Amazon Type : recherche | Indexe le web pour les fonctions de recherche d'Amazon, dont Alexa. Amazon précise qu'il ne sert pas à l'entraînement de modèles d'IA générative. Respecte robots.txt. User-Agent : contient Amzn-SearchBot/0.1 IP publiées : liste Amazon |
| Amzn-User Propriétaire : Amazon Type : requête d'un utilisateur | Va chercher une page à la demande d'un utilisateur, par exemple pour une question posée à Alexa. Pas d'entraînement. Amazon indique qu'il peut ne pas suivre toutes les règles du robots.txt. IP publiées : liste Amazon |
| anthropic-ai Propriétaire : Anthropic (supposé) | Souvent cité comme robot d'entraînement d'Anthropic, mais il ne figure pas dans la documentation officielle d'Anthropic, qui ne liste que ClaudeBot, Claude-SearchBot et Claude-User. Même chose pour Claude-Web. Je le laisse ici parce qu'on le trouve dans beaucoup de fichiers robots.txt, mais le bloquer ne sert probablement à rien. |
| Applebot Propriétaire : Apple Type : recherche et entraînement | Indexe le web pour Spotlight, Siri et Safari. D'après Apple, les données collectées servent aussi à entraîner les modèles d'Apple Intelligence, sauf si vous l'interdisez via Applebot-Extended. Respecte robots.txt. User-Agent : Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/605.1.15 (KHTML, like Gecko) Version/17.4 Safari/605.1.15 (Applebot/0.1; +http://www.apple.com/go/applebot) IP publiées : applebot.json |
| Applebot-Extended Propriétaire : Apple Type : entraînement (jeton robots.txt) | Ce n'est pas un robot : Apple précise qu'il n'explore aucune page. C'est un nom à utiliser dans le robots.txt pour interdire l'usage, pour l'entraînement des modèles d'Apple, des pages déjà collectées par Applebot. Votre présence dans Spotlight et Siri n'est pas affectée. |
| Bingbot Propriétaire : Microsoft Type : recherche (hybride) | Crawler principal de Bing. Microsoft a indiqué que le contenu de son index sert aussi à Copilot et à l'entraînement de ses modèles d'IA générative. Il n'y a pas de robot IA séparé à bloquer : le contrôle passe par les balises meta robots (avec NOARCHIVE, le contenu est exclu des réponses de Copilot et de l'entraînement). User-Agent : Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; bingbot/2.0; +http://www.bing.com/bingbot.htm) Chrome/W.X.Y.Z Safari/537.36 IP publiées : bingbot.json |
| Bytespider Propriétaire : ByteDance (TikTok) Type : entraînement | Associé à l'entraînement des modèles de ByteDance (Doubao). ByteDance ne publie pas de documentation officielle, et ce robot a la réputation de ne pas respecter robots.txt. Le token Bytespider apparaît dans des user-agents variés. User-Agent observé dans mes logs : Mozilla/5.0 (Linux; Android 5.0) AppleWebKit/537.36 (KHTML, like Gecko) Mobile Safari/537.36 (compatible; Bytespider; spider-feedback@bytedance.com) |
| CCBot Propriétaire : Common Crawl Type : données pour des tiers | Le crawler de l'organisation à but non lucratif Common Crawl, qui publie une copie ouverte du web. Ce n'est pas un robot d'IA en soi, mais ses données sont une source majeure pour l'entraînement de nombreux LLM. Respecte robots.txt. User-Agent : CCBot/2.0 (https://commoncrawl.org/faq/) IP publiées : ccbot.json |
| ChatGPT-User Propriétaire : OpenAI Type : requête d'un utilisateur | Va chercher une page quand un utilisateur de ChatGPT ou d'un GPT personnalisé le demande. Il ne crawle pas de manière proactive. OpenAI indique que, la demande venant d'un utilisateur, les règles du robots.txt peuvent ne pas s'appliquer. User-Agent : Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; ChatGPT-User/1.0; +https://openai.com/bot IP publiées : chatgpt-user.json |
| Claude-SearchBot Propriétaire : Anthropic Type : recherche | Indexe le web pour améliorer la qualité des résultats de recherche fournis par Claude. Respecte robots.txt et Crawl-delay. User-Agent observé dans mes logs : Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Claude-SearchBot/1.0; +claudebot@anthropic.com) IP publiées : bots.json (commun aux 3 robots d'Anthropic) |
| Claude-User Propriétaire : Anthropic Type : requête d'un utilisateur | Visite une page à la demande d'un utilisateur de Claude. Contrairement à OpenAI et Perplexity, Anthropic indique que ce robot respecte lui aussi robots.txt. On le voit également passer quand un développeur utilise Claude Code. User-Agent observé dans mes logs : Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Claude-User/1.0; +claude-user@anthropic.com), ou Claude-User (claude-code/…) pour Claude Code |
| ClaudeBot Propriétaire : Anthropic Type : entraînement | Collecte du contenu web pour entraîner les modèles d'Anthropic (famille Claude). Respecte robots.txt et Crawl-delay. Anthropic ne publie que les noms de ses robots, pas leurs user-agents complets. User-Agent observé dans mes logs : Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com) IP publiées : bots.json |
| cohere-ai Propriétaire : Cohere (supposé) | Souvent cité comme robot d'entraînement de Cohere, tout comme cohere-training-data-crawler. Mais la documentation de Cohere affirme le contraire : Cohere dit ne pas utiliser de robot pour collecter du contenu web destiné à entraîner ses modèles. |
| DeepSeekBot Propriétaire : DeepSeek (supposé) Type : entraînement (supposé) | DeepSeek ne publie aucune documentation sur un robot. Dans mes logs, la grande majorité des requêtes qui se présentent comme DeepSeekBot viennent en réalité de scanners qui cherchent des fichiers sensibles (.env, .git, clés AWS) : c'est un déguisement courant. User-Agent observé : Mozilla/5.0 (compatible; DeepSeekBot/1.0; +https://www.deepseek.com/) |
| Diffbot Propriétaire : Diffbot Type : données pour des tiers | Transforme les pages web en données structurées, vendues par API à des entreprises, notamment pour l'IA. Respecte robots.txt et Crawl-delay par défaut, mais Diffbot indique que ses clients peuvent passer outre. Existe aussi en version Diffbot-User. |
| DuckAssistBot Propriétaire : DuckDuckGo Type : recherche | Récupère des pages en temps réel pour les réponses assistées par IA de DuckDuckGo. DuckDuckGo précise qu'il ne sert pas à entraîner des modèles. Respecte robots.txt (un changement est pris en compte sous 72 heures). User-Agent : DuckAssistBot/1.2; (+http://duckduckgo.com/duckassistbot.html) IP publiées : duckassistbot.json |
| ExaSearchBot Propriétaire : Exa Type : recherche pour des tiers | Construit l'index du moteur de recherche Exa, vendu par API aux applications d'IA. Respecte robots.txt (sans règle dédiée, il suit celles données aux grands moteurs, puis celles de User-agent: *). User-Agent : Mozilla/5.0 (compatible; ExaSearchBot/1.0; +https://crawler.exa.ai/) |
| facebookexternalhit Propriétaire : Meta Type : aperçus de liens | Récupère le titre, la description et l'image d'une page quand un lien est partagé sur Facebook, Instagram, WhatsApp, etc. Ce n'est pas un robot d'IA. Meta indique qu'il peut ignorer robots.txt pour des contrôles de sécurité. L'ancien FacebookBot n'est plus mentionné dans la documentation de Meta : les robots d'IA de Meta sont les meta-external* et meta-webindexer ci-dessous. User-Agent : facebookexternalhit/1.1 (+http://www.facebook.com/externalhit_uatext.php) |
| Google-Agent Propriétaire : Google Type : requête d'un utilisateur | Utilisé par les agents hébergés chez Google pour naviguer sur le web et effectuer des actions à la demande d'un utilisateur. Comme tous les robots de Google déclenchés par un utilisateur, il ignore robots.txt. Au passage, il n'existe pas de robot officiel nommé "Gemini-User". User-Agent : Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko; compatible; Google-Agent; +https://developers.google.com/crawling/docs/crawlers-fetchers/google-agent) Chrome/W.X.Y.Z Safari/537.36 IP publiées : user-triggered-agents.json |
| Google-CloudVertexBot Propriétaire : Google Type : requête du propriétaire du site | Explore un site à la demande de son propriétaire, pour construire des agents avec Vertex AI (Google Cloud). Il ne passe que si quelqu'un l'a configuré pour votre site. User-Agent : contient Google-CloudVertexBot |
| Google-Extended Propriétaire : Google Type : entraînement (jeton robots.txt) | Ce n'est pas un robot : c'est un nom à utiliser dans le robots.txt pour interdire l'usage de vos pages pour entraîner les futurs modèles Gemini et pour le grounding (Gemini, Vertex AI). Le crawl est fait par les robots habituels de Google. L'interdire n'a aucun effet sur l'indexation ni sur le classement dans Google, et n'empêche pas l'apparition dans les AI Overviews, qui dépendent de Googlebot. |
| Google-GeminiNotebook Propriétaire : Google Type : requête d'un utilisateur | Récupère les URL qu'un utilisateur ajoute comme sources dans Gemini Notebook (anciennement NotebookLM, dont le robot Google-NotebookLM a été remplacé en août 2026). Ignore robots.txt. User-Agent : Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/137.0.0.0 Safari/537.36 (compatible; Google-GeminiNotebook; +https://developers.google.com/crawling/docs/crawlers-fetchers/google-gemininotebook) |
| GoogleOther Propriétaire : Google Type : usage interne | Crawler générique utilisé par différentes équipes de Google, notamment pour de la recherche et développement. Il est distinct du crawl pour Google Search. Existe aussi en versions GoogleOther-Image et GoogleOther-Video. User-Agent : Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; GoogleOther) Chrome/W.X.Y.Z Safari/537.36 IP publiées : common-crawlers.json |
| GPTBot Propriétaire : OpenAI Type : entraînement | Collecte des pages pour entraîner les modèles d'IA générative d'OpenAI. Le bloquer indique que vos pages ne doivent pas servir à l'entraînement, sans effet sur votre présence dans ChatGPT Search (qui dépend d'OAI-SearchBot). User-Agent : Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.4; +https://openai.com/gptbot IP publiées : gptbot.json |
| Grok Propriétaire : xAI | xAI ne documente aucun crawler officiel. Les noms parfois cités (GrokBot, xAI-Grok) ne sont confirmés par aucune source officielle, et Grok semble utiliser des user-agents de navigateur, ce qui rend son identification difficile. |
| IbouBot Propriétaire : Ibou (Babbar) Type : recherche | Alimente le moteur de recherche Ibou. Ibou précise ne pas entraîner de modèle d'IA avec ces données. Respecte robots.txt et Crawl-delay. User-Agent : Mozilla/5.0 (compatible; IbouBot/1.0; +bot@ibou.io; +https://ibou.io/iboubot.html) |
| LinkedInBot Propriétaire : LinkedIn (Microsoft) Type : aperçus de liens | Extrait les données Open Graph pour les aperçus de liens partagés sur LinkedIn. LinkedIn ne documente pas d'usage de ce robot pour l'IA. User-Agent : LinkedInBot/1.0 (compatible; Mozilla/5.0; Apache-HttpClient +http://www.linkedin.com) |
| LinkupBot Propriétaire : Linkup Type : recherche pour des tiers | Construit un index de recherche vendu aux applications d'IA, qui s'en servent pour sourcer leurs réponses. Respecte robots.txt. User-Agent : LinkupBot/1.0 (LinkupBot for web indexing; https://www.linkup.so/bot; bot@linkup.so) IP publiées : linkupbot-ips.txt |
| meta-externalagent Propriétaire : Meta Type : entraînement | Collecte du contenu web pour entraîner les modèles d'IA de Meta (Llama) et, selon Meta, pour améliorer ses produits en indexant du contenu. Meta dit qu'il respecte robots.txt, mais je constate le contraire sur mon site (voir plus bas). User-Agent : meta-externalagent/1.1 (+https://developers.facebook.com/docs/sharing/webmasters/crawler) |
| meta-externalfetcher Propriétaire : Meta Type : requête d'un utilisateur | Va chercher une page à la demande d'un utilisateur des produits de Meta. Meta indique qu'il peut ignorer robots.txt. User-Agent : meta-externalfetcher/1.1 |
| meta-webindexer Propriétaire : Meta Type : recherche | Explore le web pour améliorer les résultats de recherche de Meta AI. D'après Meta, c'est lui qui permet que votre contenu soit cité avec un lien dans les réponses de Meta AI : si vous bloquez meta-externalagent, laissez passer celui-ci. User-Agent : meta-webindexer/1.1 (+https://developers.facebook.com/docs/sharing/webmasters/crawler) |
| MistralAI-Index Propriétaire : Mistral AI Type : recherche | Indexe le web pour la recherche de Mistral (Le Chat). Mistral précise qu'il ne sert pas à l'entraînement. User-Agent : Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; MistralAI-Index/1.0; +https://docs.mistral.ai/robots) IP publiées : mistralai-index-ips.json |
| MistralAI-Training Propriétaire : Mistral AI Type : entraînement | Collecte des pages pour constituer les jeux de données d'entraînement des modèles de Mistral. Peut être bloqué dans le robots.txt. User-Agent : Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; MistralAI-Training/1.0; +https://docs.mistral.ai/robots) |
| MistralAI-User Propriétaire : Mistral AI Type : requête d'un utilisateur | Va chercher une page à la demande d'un utilisateur des produits de Mistral. Mistral précise qu'il ne crawle pas le web automatiquement et ne sert pas à l'entraînement. User-Agent : Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; MistralAI-User/1.0; +https://docs.mistral.ai/robots) IP publiées : mistralai-user-ips.json |
| OAI-AdsBot Propriétaire : OpenAI Type : publicité | Vérifie la sécurité et la pertinence des pages soumises comme publicités sur ChatGPT. OpenAI précise qu'il ne sert pas à entraîner ses modèles. User-Agent : Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; OAI-AdsBot/1.0; +https://openai.com/adsbot IP publiées : adsbot.json |
| OAI-SearchBot Propriétaire : OpenAI Type : recherche | Crawler de la recherche web de ChatGPT, celui qui permet d'apparaître avec un lien dans les réponses. OpenAI précise qu'un site qui le bloque n'apparaît pas dans les réponses de recherche, et qu'il ne sert pas à l'entraînement. User-Agent : Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/131.0.0.0 Safari/537.36; compatible; OAI-SearchBot/1.4; +https://openai.com/searchbot IP publiées : searchbot.json |
| omgili Propriétaire : Webz.io Type : données pour des tiers | Spécialisé dans les contenus conversationnels (forums, commentaires, discussions), revendus notamment à des développeurs de LLM. Respecte robots.txt. Webz.io propose aussi les jetons Webzio et Webzio-extended pour indiquer si les données peuvent servir à l'entraînement d'IA. User-Agent : omgili/0.5 +https://omgili.com |
| Perplexity-User Propriétaire : Perplexity AI Type : requête d'un utilisateur | Visite une page à la demande d'un utilisateur de Perplexity, par exemple quand il clique sur une source. Perplexity indique qu'il ignore généralement robots.txt, puisque la demande vient d'un utilisateur. Ne sert pas à l'entraînement. User-Agent : Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Perplexity-User/1.0; +https://perplexity.ai/perplexity-user) IP publiées : perplexity-user.json |
| PerplexityBot Propriétaire : Perplexity AI Type : recherche | Indexe le web pour alimenter le moteur de réponses de Perplexity, avec des liens vers les sources. Respecte robots.txt, et Perplexity précise qu'il ne sert pas à l'entraînement de modèles. Perplexity a toutefois été accusé d'utiliser aussi des crawlers non déclarés, avec des user-agents de navigateur, pour contourner les blocages. User-Agent : Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; PerplexityBot/1.0; +https://perplexity.ai/perplexitybot) IP publiées : perplexitybot.json |
| SofyaBot Propriétaire : Sofya Type : recherche pour des tiers | Construit l'index de recherche que Sofya vend par API aux agents IA. Respecte robots.txt et Crawl-delay. User-Agent : SofyaBot/1.0 (+https://sofya.co/bot) |
| YouBot Propriétaire : You.com Type : recherche | Crawler du moteur de recherche de You.com, dont les réponses IA s'appuient sur des sources web. Respecte robots.txt et Crawl-delay. User-Agent : Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; YouBot/1.0; +https://docs.you.com/youbot; env:prod) Chrome/X.X.X.X Safari/537.36 |
Ce que j'observe dans les logs de WebRankInfo
J'ai analysé les logs du serveur de WebRankInfo sur août et septembre 2026, soit 34 millions de requêtes en 58 jours. Voici quelques constats, qui ne valent que pour mon site mais qui donnent des ordres de grandeur...
60 % des requêtes venaient de robots d'entraînement d'IA, contre 6 % pour les moteurs de recherche classiques
meta-externalagent faisait à lui seul 44 % des requêtes du site (260 000 par jour, 89 Go servis en deux mois), dont 60 % sur des pages de résultats de recherche du forum, pourtant interdites dans mon robots.txt depuis longtemps. En dehors des robots de Meta (meta-webindexer aussi, dans une moindre mesure), aucun robot d'IA n'allait sur ces pages. J'ai fini par le bloquer au niveau du serveur (code 403).
Derrière, on trouve ClaudeBot (3,6 millions de requêtes), Amazonbot (1 million), meta-webindexer (476 000) et GPTBot (205 000). Les robots de recherche (OAI-SearchBot, PerplexityBot, Claude-SearchBot) et les requêtes d'utilisateurs (ChatGPT-User, Perplexity-User) pèsent beaucoup moins lourd.
Beaucoup de requêtes qui se présentent comme des robots d'IA sont fausses : des scanners qui cherchent des fichiers sensibles (.env, .git, clés d'accès) empruntent les noms de DeepSeekBot, Claude-SearchBot, MistralAI-User ou même Googlebot.
Ce dernier point est important : un user-agent se falsifie en une ligne. Avant de conclure qu'un robot d'IA se comporte mal (ou qu'il vient bien sur votre site), vérifiez l'adresse IP de la requête dans les listes publiées par l'éditeur, que j'ai indiquées dans le tableau quand elles existent.
Voir aussi :
- les crawlers de ChatGPT / OpenAI
- faut-il créer un fichier LLMS.txt ?
- mesurer le trafic des moteurs IA
- le mécanisme du query fan-out
- tester l'accès des robots IA à votre site
Sources (documentation officielle de chaque éditeur) :
- OpenAI : Overview of OpenAI Crawlers
- Anthropic : Does Anthropic crawl data from the web, and how can site owners block the crawler?
- Google : Google's common crawlers et Google's user-triggered fetchers
- Perplexity : Perplexity Crawlers
- Meta : Meta Web Crawlers
- Apple : About Applebot
- Microsoft : Announcing new options for webmasters to control usage of their content in Bing Chat
- Amazon : Amazonbot
- Mistral AI : Mistral AI robots
- DuckDuckGo : DuckAssistBot
- Cohere : Cohere Web Crawlers
- Common Crawl : CCBot
- Allen Institute for AI : AI2Bot
- You.com : YouBot
- Exa : ExaSearchBot ; Linkup : LinkupBot ; Sofya : SofyaBot
- Webz.io : Webz.io bots ; Diffbot : Diffbot and robots.txt
- Ibou : IbouBot
Note : ByteDance (Bytespider), DeepSeek, xAI (Grok) et LinkedIn ne publient pas de documentation officielle sur leurs crawlers au moment où j'écris ces lignes. Pour ces robots, les informations viennent de mes propres logs et doivent être prises avec prudence.
Si vous avez des questions, posez-les dans le forum WebRankInfo.
Si vous préférez du consulting, j'en propose sur mon site WebRankExpert.
Article très intéressant concernant tous ces robots, plus ou moins connus: merci