Les crawlers des moteurs IA
Portrait Olivier Duffez

Olivier Duffez

Créateur de WebRankInfo,
expert SEO

Consultant SEO depuis 2003, j'accompagne mes clients dans leur stratégie SEO

  • Olivier Duffez sur LinkedIn
  • Consulting avec Olivier Duffez (Web Rank Expert))

Liste des crawlers des moteurs IA

Si vous souhaitez les bloquer ou au contraire assurer qu'ils accèdent bien à votre site, voici la liste des principaux crawlers des "moteurs IA" (ChatGPT, Gemini, Perplexity, Claude, Mistral et tous les autres)

Partagez cette page :

Les 3 types de crawlers IA

Avant de bloquer quoi que ce soit, il faut distinguer le rôle de chaque robot. La plupart des éditeurs d'IA en ont désormais plusieurs, et bloquer le mauvais n'a pas du tout le même effet :

  • entraînement : le robot collecte des pages pour entraîner les futurs modèles. Le bloquer ne vous retire pas des réponses actuelles, mais les modèles suivants connaîtront moins bien votre site "de mémoire" (exemples : GPTBot, ClaudeBot, meta-externalagent)
  • recherche : le robot construit l'index dans lequel l'assistant va chercher ses sources, et c'est lui qui permet d'être cité avec un lien. Le bloquer, c'est disparaître des réponses sourcées (exemples : OAI-SearchBot, Claude-SearchBot, PerplexityBot, meta-webindexer)
  • requête d'un utilisateur : le robot va chercher une page précise parce qu'un utilisateur la demande, en direct. Plusieurs éditeurs indiquent que ces robots peuvent ignorer le fichier robots.txt, puisque c'est un humain qui a fait la demande (exemples : ChatGPT-User, Perplexity-User, Google-Agent)

Autrement dit, on peut très bien refuser l'entraînement tout en restant visible dans ChatGPT, Claude ou Perplexity : il suffit de bloquer les robots d'entraînement et de laisser passer ceux de recherche.

Pour voir ce que votre site laisse réellement passer, robot par robot, testez-le avec mon outil d'accès des robots IA.

Liste des crawlers IA

NomDescription
AI2Bot

Propriétaire : Allen Institute for AI
Type : entraînement
Collecte des pages pour entraîner les modèles de langage ouverts de l'Allen Institute.
User-Agent : Mozilla/5.0 (compatible) AI2Bot (+https://www.allenai.org/crawler)
Amazonbot

Propriétaire : Amazon
Type : entraînement et produits Amazon
Sert à améliorer les produits et services d'Amazon, et d'après Amazon, peut être utilisé pour entraîner ses modèles d'IA. Respecte robots.txt (qu'il garde en cache jusqu'à 30 jours), mais pas Crawl-delay.
User-Agent : Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Amazonbot/0.1) Chrome/W.X.Y.Z Safari/537.36
IP publiées : liste Amazon
Amzn-SearchBot

Propriétaire : Amazon
Type : recherche
Indexe le web pour les fonctions de recherche d'Amazon, dont Alexa. Amazon précise qu'il ne sert pas à l'entraînement de modèles d'IA générative. Respecte robots.txt.
User-Agent : contient Amzn-SearchBot/0.1
IP publiées : liste Amazon
Amzn-User

Propriétaire : Amazon
Type : requête d'un utilisateur
Va chercher une page à la demande d'un utilisateur, par exemple pour une question posée à Alexa. Pas d'entraînement. Amazon indique qu'il peut ne pas suivre toutes les règles du robots.txt.
IP publiées : liste Amazon
anthropic-ai

Propriétaire : Anthropic (supposé)
Souvent cité comme robot d'entraînement d'Anthropic, mais il ne figure pas dans la documentation officielle d'Anthropic, qui ne liste que ClaudeBot, Claude-SearchBot et Claude-User. Même chose pour Claude-Web. Je le laisse ici parce qu'on le trouve dans beaucoup de fichiers robots.txt, mais le bloquer ne sert probablement à rien.
Applebot

Propriétaire : Apple
Type : recherche et entraînement
Indexe le web pour Spotlight, Siri et Safari. D'après Apple, les données collectées servent aussi à entraîner les modèles d'Apple Intelligence, sauf si vous l'interdisez via Applebot-Extended. Respecte robots.txt.
User-Agent : Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/605.1.15 (KHTML, like Gecko) Version/17.4 Safari/605.1.15 (Applebot/0.1; +http://www.apple.com/go/applebot)
IP publiées : applebot.json
Applebot-Extended

Propriétaire : Apple
Type : entraînement (jeton robots.txt)
Ce n'est pas un robot : Apple précise qu'il n'explore aucune page. C'est un nom à utiliser dans le robots.txt pour interdire l'usage, pour l'entraînement des modèles d'Apple, des pages déjà collectées par Applebot. Votre présence dans Spotlight et Siri n'est pas affectée.
Bingbot

Propriétaire : Microsoft
Type : recherche (hybride)
Crawler principal de Bing. Microsoft a indiqué que le contenu de son index sert aussi à Copilot et à l'entraînement de ses modèles d'IA générative. Il n'y a pas de robot IA séparé à bloquer : le contrôle passe par les balises meta robots (avec NOARCHIVE, le contenu est exclu des réponses de Copilot et de l'entraînement).
User-Agent : Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; bingbot/2.0; +http://www.bing.com/bingbot.htm) Chrome/W.X.Y.Z Safari/537.36
IP publiées : bingbot.json
Bytespider

Propriétaire : ByteDance (TikTok)
Type : entraînement
Associé à l'entraînement des modèles de ByteDance (Doubao). ByteDance ne publie pas de documentation officielle, et ce robot a la réputation de ne pas respecter robots.txt. Le token Bytespider apparaît dans des user-agents variés.
User-Agent observé dans mes logs : Mozilla/5.0 (Linux; Android 5.0) AppleWebKit/537.36 (KHTML, like Gecko) Mobile Safari/537.36 (compatible; Bytespider; spider-feedback@bytedance.com)
CCBot

Propriétaire : Common Crawl
Type : données pour des tiers
Le crawler de l'organisation à but non lucratif Common Crawl, qui publie une copie ouverte du web. Ce n'est pas un robot d'IA en soi, mais ses données sont une source majeure pour l'entraînement de nombreux LLM. Respecte robots.txt.
User-Agent : CCBot/2.0 (https://commoncrawl.org/faq/)
IP publiées : ccbot.json
ChatGPT-User

Propriétaire : OpenAI
Type : requête d'un utilisateur
Va chercher une page quand un utilisateur de ChatGPT ou d'un GPT personnalisé le demande. Il ne crawle pas de manière proactive. OpenAI indique que, la demande venant d'un utilisateur, les règles du robots.txt peuvent ne pas s'appliquer.
User-Agent : Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; ChatGPT-User/1.0; +https://openai.com/bot
IP publiées : chatgpt-user.json
Claude-SearchBot

Propriétaire : Anthropic
Type : recherche
Indexe le web pour améliorer la qualité des résultats de recherche fournis par Claude. Respecte robots.txt et Crawl-delay.
User-Agent observé dans mes logs : Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Claude-SearchBot/1.0; +claudebot@anthropic.com)
IP publiées : bots.json (commun aux 3 robots d'Anthropic)
Claude-User

Propriétaire : Anthropic
Type : requête d'un utilisateur
Visite une page à la demande d'un utilisateur de Claude. Contrairement à OpenAI et Perplexity, Anthropic indique que ce robot respecte lui aussi robots.txt. On le voit également passer quand un développeur utilise Claude Code.
User-Agent observé dans mes logs : Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Claude-User/1.0; +claude-user@anthropic.com), ou Claude-User (claude-code/…) pour Claude Code
ClaudeBot

Propriétaire : Anthropic
Type : entraînement
Collecte du contenu web pour entraîner les modèles d'Anthropic (famille Claude). Respecte robots.txt et Crawl-delay. Anthropic ne publie que les noms de ses robots, pas leurs user-agents complets.
User-Agent observé dans mes logs : Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
IP publiées : bots.json
cohere-ai

Propriétaire : Cohere (supposé)
Souvent cité comme robot d'entraînement de Cohere, tout comme cohere-training-data-crawler. Mais la documentation de Cohere affirme le contraire : Cohere dit ne pas utiliser de robot pour collecter du contenu web destiné à entraîner ses modèles.
DeepSeekBot

Propriétaire : DeepSeek (supposé)
Type : entraînement (supposé)
DeepSeek ne publie aucune documentation sur un robot. Dans mes logs, la grande majorité des requêtes qui se présentent comme DeepSeekBot viennent en réalité de scanners qui cherchent des fichiers sensibles (.env, .git, clés AWS) : c'est un déguisement courant.
User-Agent observé : Mozilla/5.0 (compatible; DeepSeekBot/1.0; +https://www.deepseek.com/)
Diffbot

Propriétaire : Diffbot
Type : données pour des tiers
Transforme les pages web en données structurées, vendues par API à des entreprises, notamment pour l'IA. Respecte robots.txt et Crawl-delay par défaut, mais Diffbot indique que ses clients peuvent passer outre. Existe aussi en version Diffbot-User.
DuckAssistBot

Propriétaire : DuckDuckGo
Type : recherche
Récupère des pages en temps réel pour les réponses assistées par IA de DuckDuckGo. DuckDuckGo précise qu'il ne sert pas à entraîner des modèles. Respecte robots.txt (un changement est pris en compte sous 72 heures).
User-Agent : DuckAssistBot/1.2; (+http://duckduckgo.com/duckassistbot.html)
IP publiées : duckassistbot.json
ExaSearchBot

Propriétaire : Exa
Type : recherche pour des tiers
Construit l'index du moteur de recherche Exa, vendu par API aux applications d'IA. Respecte robots.txt (sans règle dédiée, il suit celles données aux grands moteurs, puis celles de User-agent: *).
User-Agent : Mozilla/5.0 (compatible; ExaSearchBot/1.0; +https://crawler.exa.ai/)
facebookexternalhit

Propriétaire : Meta
Type : aperçus de liens
Récupère le titre, la description et l'image d'une page quand un lien est partagé sur Facebook, Instagram, WhatsApp, etc. Ce n'est pas un robot d'IA. Meta indique qu'il peut ignorer robots.txt pour des contrôles de sécurité. L'ancien FacebookBot n'est plus mentionné dans la documentation de Meta : les robots d'IA de Meta sont les meta-external* et meta-webindexer ci-dessous.
User-Agent : facebookexternalhit/1.1 (+http://www.facebook.com/externalhit_uatext.php)
Google-Agent

Propriétaire : Google
Type : requête d'un utilisateur
Utilisé par les agents hébergés chez Google pour naviguer sur le web et effectuer des actions à la demande d'un utilisateur. Comme tous les robots de Google déclenchés par un utilisateur, il ignore robots.txt. Au passage, il n'existe pas de robot officiel nommé "Gemini-User".
User-Agent : Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko; compatible; Google-Agent; +https://developers.google.com/crawling/docs/crawlers-fetchers/google-agent) Chrome/W.X.Y.Z Safari/537.36
IP publiées : user-triggered-agents.json
Google-CloudVertexBot

Propriétaire : Google
Type : requête du propriétaire du site
Explore un site à la demande de son propriétaire, pour construire des agents avec Vertex AI (Google Cloud). Il ne passe que si quelqu'un l'a configuré pour votre site.
User-Agent : contient Google-CloudVertexBot
Google-Extended

Propriétaire : Google
Type : entraînement (jeton robots.txt)
Ce n'est pas un robot : c'est un nom à utiliser dans le robots.txt pour interdire l'usage de vos pages pour entraîner les futurs modèles Gemini et pour le grounding (Gemini, Vertex AI). Le crawl est fait par les robots habituels de Google. L'interdire n'a aucun effet sur l'indexation ni sur le classement dans Google, et n'empêche pas l'apparition dans les AI Overviews, qui dépendent de Googlebot.
Google-GeminiNotebook

Propriétaire : Google
Type : requête d'un utilisateur
Récupère les URL qu'un utilisateur ajoute comme sources dans Gemini Notebook (anciennement NotebookLM, dont le robot Google-NotebookLM a été remplacé en août 2026). Ignore robots.txt.
User-Agent : Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/137.0.0.0 Safari/537.36 (compatible; Google-GeminiNotebook; +https://developers.google.com/crawling/docs/crawlers-fetchers/google-gemininotebook)
GoogleOther

Propriétaire : Google
Type : usage interne
Crawler générique utilisé par différentes équipes de Google, notamment pour de la recherche et développement. Il est distinct du crawl pour Google Search. Existe aussi en versions GoogleOther-Image et GoogleOther-Video.
User-Agent : Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; GoogleOther) Chrome/W.X.Y.Z Safari/537.36
IP publiées : common-crawlers.json
GPTBot

Propriétaire : OpenAI
Type : entraînement
Collecte des pages pour entraîner les modèles d'IA générative d'OpenAI. Le bloquer indique que vos pages ne doivent pas servir à l'entraînement, sans effet sur votre présence dans ChatGPT Search (qui dépend d'OAI-SearchBot).
User-Agent : Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.4; +https://openai.com/gptbot
IP publiées : gptbot.json
Grok

Propriétaire : xAI
xAI ne documente aucun crawler officiel. Les noms parfois cités (GrokBot, xAI-Grok) ne sont confirmés par aucune source officielle, et Grok semble utiliser des user-agents de navigateur, ce qui rend son identification difficile.
IbouBot

Propriétaire : Ibou (Babbar)
Type : recherche
Alimente le moteur de recherche Ibou. Ibou précise ne pas entraîner de modèle d'IA avec ces données. Respecte robots.txt et Crawl-delay.
User-Agent : Mozilla/5.0 (compatible; IbouBot/1.0; +bot@ibou.io; +https://ibou.io/iboubot.html)
LinkedInBot

Propriétaire : LinkedIn (Microsoft)
Type : aperçus de liens
Extrait les données Open Graph pour les aperçus de liens partagés sur LinkedIn. LinkedIn ne documente pas d'usage de ce robot pour l'IA.
User-Agent : LinkedInBot/1.0 (compatible; Mozilla/5.0; Apache-HttpClient +http://www.linkedin.com)
LinkupBot

Propriétaire : Linkup
Type : recherche pour des tiers
Construit un index de recherche vendu aux applications d'IA, qui s'en servent pour sourcer leurs réponses. Respecte robots.txt.
User-Agent : LinkupBot/1.0 (LinkupBot for web indexing; https://www.linkup.so/bot; bot@linkup.so)
IP publiées : linkupbot-ips.txt
meta-externalagent

Propriétaire : Meta
Type : entraînement
Collecte du contenu web pour entraîner les modèles d'IA de Meta (Llama) et, selon Meta, pour améliorer ses produits en indexant du contenu. Meta dit qu'il respecte robots.txt, mais je constate le contraire sur mon site (voir plus bas).
User-Agent : meta-externalagent/1.1 (+https://developers.facebook.com/docs/sharing/webmasters/crawler)
meta-externalfetcher

Propriétaire : Meta
Type : requête d'un utilisateur
Va chercher une page à la demande d'un utilisateur des produits de Meta. Meta indique qu'il peut ignorer robots.txt.
User-Agent : meta-externalfetcher/1.1
meta-webindexer

Propriétaire : Meta
Type : recherche
Explore le web pour améliorer les résultats de recherche de Meta AI. D'après Meta, c'est lui qui permet que votre contenu soit cité avec un lien dans les réponses de Meta AI : si vous bloquez meta-externalagent, laissez passer celui-ci.
User-Agent : meta-webindexer/1.1 (+https://developers.facebook.com/docs/sharing/webmasters/crawler)
MistralAI-Index

Propriétaire : Mistral AI
Type : recherche
Indexe le web pour la recherche de Mistral (Le Chat). Mistral précise qu'il ne sert pas à l'entraînement.
User-Agent : Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; MistralAI-Index/1.0; +https://docs.mistral.ai/robots)
IP publiées : mistralai-index-ips.json
MistralAI-Training

Propriétaire : Mistral AI
Type : entraînement
Collecte des pages pour constituer les jeux de données d'entraînement des modèles de Mistral. Peut être bloqué dans le robots.txt.
User-Agent : Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; MistralAI-Training/1.0; +https://docs.mistral.ai/robots)
MistralAI-User

Propriétaire : Mistral AI
Type : requête d'un utilisateur
Va chercher une page à la demande d'un utilisateur des produits de Mistral. Mistral précise qu'il ne crawle pas le web automatiquement et ne sert pas à l'entraînement.
User-Agent : Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; MistralAI-User/1.0; +https://docs.mistral.ai/robots)
IP publiées : mistralai-user-ips.json
OAI-AdsBot

Propriétaire : OpenAI
Type : publicité
Vérifie la sécurité et la pertinence des pages soumises comme publicités sur ChatGPT. OpenAI précise qu'il ne sert pas à entraîner ses modèles.
User-Agent : Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; OAI-AdsBot/1.0; +https://openai.com/adsbot
IP publiées : adsbot.json
OAI-SearchBot

Propriétaire : OpenAI
Type : recherche
Crawler de la recherche web de ChatGPT, celui qui permet d'apparaître avec un lien dans les réponses. OpenAI précise qu'un site qui le bloque n'apparaît pas dans les réponses de recherche, et qu'il ne sert pas à l'entraînement.
User-Agent : Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/131.0.0.0 Safari/537.36; compatible; OAI-SearchBot/1.4; +https://openai.com/searchbot
IP publiées : searchbot.json
omgili

Propriétaire : Webz.io
Type : données pour des tiers
Spécialisé dans les contenus conversationnels (forums, commentaires, discussions), revendus notamment à des développeurs de LLM. Respecte robots.txt. Webz.io propose aussi les jetons Webzio et Webzio-extended pour indiquer si les données peuvent servir à l'entraînement d'IA.
User-Agent : omgili/0.5 +https://omgili.com
Perplexity-User

Propriétaire : Perplexity AI
Type : requête d'un utilisateur
Visite une page à la demande d'un utilisateur de Perplexity, par exemple quand il clique sur une source. Perplexity indique qu'il ignore généralement robots.txt, puisque la demande vient d'un utilisateur. Ne sert pas à l'entraînement.
User-Agent : Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Perplexity-User/1.0; +https://perplexity.ai/perplexity-user)
IP publiées : perplexity-user.json
PerplexityBot

Propriétaire : Perplexity AI
Type : recherche
Indexe le web pour alimenter le moteur de réponses de Perplexity, avec des liens vers les sources. Respecte robots.txt, et Perplexity précise qu'il ne sert pas à l'entraînement de modèles. Perplexity a toutefois été accusé d'utiliser aussi des crawlers non déclarés, avec des user-agents de navigateur, pour contourner les blocages.
User-Agent : Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; PerplexityBot/1.0; +https://perplexity.ai/perplexitybot)
IP publiées : perplexitybot.json
SofyaBot

Propriétaire : Sofya
Type : recherche pour des tiers
Construit l'index de recherche que Sofya vend par API aux agents IA. Respecte robots.txt et Crawl-delay.
User-Agent : SofyaBot/1.0 (+https://sofya.co/bot)
YouBot

Propriétaire : You.com
Type : recherche
Crawler du moteur de recherche de You.com, dont les réponses IA s'appuient sur des sources web. Respecte robots.txt et Crawl-delay.
User-Agent : Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; YouBot/1.0; +https://docs.you.com/youbot; env:prod) Chrome/X.X.X.X Safari/537.36

Ce que j'observe dans les logs de WebRankInfo

J'ai analysé les logs du serveur de WebRankInfo sur août et septembre 2026, soit 34 millions de requêtes en 58 jours. Voici quelques constats, qui ne valent que pour mon site mais qui donnent des ordres de grandeur...

60 % des requêtes venaient de robots d'entraînement d'IA, contre 6 % pour les moteurs de recherche classiques

meta-externalagent faisait à lui seul 44 % des requêtes du site (260 000 par jour, 89 Go servis en deux mois), dont 60 % sur des pages de résultats de recherche du forum, pourtant interdites dans mon robots.txt depuis longtemps. En dehors des robots de Meta (meta-webindexer aussi, dans une moindre mesure), aucun robot d'IA n'allait sur ces pages. J'ai fini par le bloquer au niveau du serveur (code 403).

Derrière, on trouve ClaudeBot (3,6 millions de requêtes), Amazonbot (1 million), meta-webindexer (476 000) et GPTBot (205 000). Les robots de recherche (OAI-SearchBot, PerplexityBot, Claude-SearchBot) et les requêtes d'utilisateurs (ChatGPT-User, Perplexity-User) pèsent beaucoup moins lourd.

Beaucoup de requêtes qui se présentent comme des robots d'IA sont fausses : des scanners qui cherchent des fichiers sensibles (.env, .git, clés d'accès) empruntent les noms de DeepSeekBot, Claude-SearchBot, MistralAI-User ou même Googlebot.

Ce dernier point est important : un user-agent se falsifie en une ligne. Avant de conclure qu'un robot d'IA se comporte mal (ou qu'il vient bien sur votre site), vérifiez l'adresse IP de la requête dans les listes publiées par l'éditeur, que j'ai indiquées dans le tableau quand elles existent.

Voir aussi :

Sources (documentation officielle de chaque éditeur) :

Note : ByteDance (Bytespider), DeepSeek, xAI (Grok) et LinkedIn ne publient pas de documentation officielle sur leurs crawlers au moment où j'écris ces lignes. Pour ces robots, les informations viennent de mes propres logs et doivent être prises avec prudence.

Partagez cette page :

Cet article vous a-t-il plu ?

Note : 5.0 (4 votes)
Cliquez pour voter !

Si vous avez des questions, posez-les dans le forum WebRankInfo.

Si vous préférez du consulting, j'en propose sur mon site WebRankExpert.

Laisser un commentaire

Remarques :

  • Si vous souhaitez poser une question ou détailler un problème technique, il ne faut pas utiliser le formulaire ci-dessous qui est réservé aux avis. Posez votre question directement dans le forum Gmail de WebRankInfo. L'inscription est gratuite et immédiate.

  • En postant un avis, vous acceptez les CGU du site WebRankInfo. Si votre avis ne respecte pas ces règles, il pourra être refusé. Si vous indiquez votre adresse email, vous serez informé dès que votre avis aura été validé (ou refusé...) ; votre adresse ne sera pas utilisée pour vous envoyer des mailings et ne sera pas revendue ou cédée à des tiers.

Un Commentaire

mVdC

Article très intéressant concernant tous ces robots, plus ou moins connus: merci

Répondre