Grosse augmentation des visites de GoogleBot suite à passage aux résultats IA

WRInaute passionné
Un effet du passage aux résultats générés par l'IA sur Google est une augmentation énorme du crawl sur mon site... depuis le 23 juillet où il y avait environ 5000 pages explorées par jour sur Smartphone de façon assez linéaire, la demande de pages est passée à plus de 55000/jour !

C'est juste pour information, mais ça va faire crever nos serveurs une telle demande...

D'autres constatent-ils cette poussée affolante dans GSC?

Pour le trafic généré par GG search, je ne vois rien de notable, ça semble stable mais mon site d'informations avait déjà tellement baissé dans les résultats "texte" que je ne risquais plus de perdre grand chose... :rolleyes:
demande GG IA.jpg
 
WRInaute impliqué
J'avais mal lu, j'ai cru que c'était la courbe des clics depuis les SERP, je me disais wahou, impressionnant, quelle chance !
Si c'est que les URL explorées, c'est déjà beaucoup moins intéressant :confused:

Bref, j'ai regardé chez moi : aucun changement particulier.
 
WRInaute passionné
@colonies : j'aurai bien aimé que ce soit une augmentation des clics... :p

Ensuite, mon site AquaPortail est quand même "un peu" cité dans les réponses IA...
 
WRInaute occasionnel
Un petit test avec l'api Cloudflare :

Code:
curl --silent --show-error --get "https://api.cloudflare.com/client/v4/radar/bots/timeseries" --data-urlencode "botOperator=Google" --data-urlencode "botCategory=SEARCH_ENGINE_CRAWLER" --data-urlencode "aggInterval=1d" --data-urlencode "dateStart=2026-07-15T00:00:00Z" --data-urlencode "dateEnd=2026-07-21T23:59:59Z" --data-urlencode "dateStart=2026-07-22T00:00:00Z" --data-urlencode "dateEnd=2026-07-28T23:59:59Z" --data-urlencode "name=15-21 juillet 2026" --data-urlencode "name=22-28 juillet 2026" --header "Authorization: Bearer votre-api-token" | jq '.result as $r | ($r["15-21 juillet 2026"].values | map(tonumber) | add) as $a | ($r["22-28 juillet 2026"].values | map(tonumber) | add) as $b | {semaine_15_21:$a,semaine_22_28:$b,multiplication:($b/$a),augmentation_pct:((($b/$a)-1)*100)}'

réponse :

Code:
{
  "semaine_15_21": 0.987538,
  "semaine_22_28": 6.837554,
  "multiplication": 6.923838880124106,
  "augmentation_pct": 592.3838880124106
}

Donc les stats Cloudflare donne bien une multiplication des requêtes de crawl émanant de Google (tous les bots, pour les sites utilisant Cloudflare, moyenne) par 6.92 (7) pour la semaine du 22-28/7 par rapport à la semaine précédente du 15-21/7/2026.

https://developers.cloudflare.com/radar/concepts/normalization/
https://api.cloudflare.com/client/v4/radar/bots/timeseries

Mais, je ne constate pas d'augmentation pour les domaines que je gére (GSC) .

Cordialement,

Eric

PS : inspiré par https://websearchapi.ai/blog/search-engine-referal-report-insights
 
WRInaute occasionnel
A mon envie l'enjeu n'est pas l'augmentation du crawl car quand google nous utilise pour ses réponses IA il a besoin comme les autres IA de crawler et recrawler l'url pour voir si l'information n'a pas changé pour donner une information fiable, l'enjeu reste le clic ou le nurturing cognitif en étant cité par les IA...bref du marketing d'influence...et là il me semble qu'il faut une forte empreinte différenciante dans le knowledge graph pour en arriver là....mais je note quand même que l'écosystème IA de google est plus fidèle sur la durée que chatgpt sur les url sélectionnées tout simplement parce que le knowledge graph a besoin de stabilité sur les entités et les triplets sémantiques informationnels....bref on reste indexés et 'positionnés" longtemps mais ça ne rapporte pas des clics nécessairement comme avant....D'ailleurs avoir comme moi des logs serveurs où bot et IA se régalent posent aussi la question du serveur, et heureusement que je ne suis pas sur un serveur partagé.... Bonne fin de week end à tous....
 
WRInaute impliqué
@colonies : j'aurai bien aimé que ce soit une augmentation des clics... :p
Est-ce que le nombre de pages connues reste stable ?

J'imagine que tu as vérifié, mais ça serait dommage de louper une multiplication d'URL avec des paramètres générés à l'infini (ou même, dans le pire des cas, un malware chopé qui crée des fausses pages).
 
WRInaute passionné
@colonies : tout est stable, c'est vraiment le crawl énorme de GG qui a décuplé.

Curieusement, avec l'arrivée de l'IA dans les résultats de recherche, je m'attendais à une légère baisse de trafic, mais il n'en est rien du tout ... pour l'instant, c'est stable et conforme à une sorte de "normale". Mon site tourne au ralenti en été, donc je vais attendre la 1er septembre pour voir ce qu'il en est réellement.

@EUSKAL CONSEIL : tu m'as un peu perdu... je vais me contenter de répondre sur l'aspect serveur.

De mon côté, le site a subi de grosses chutes en mars 2024 (arrivée de l'intention de la requête) puis idem en 2025. Avec l'IA dans les réponses GG, certaines pages qui avaient été "sanctionnées" (style page 3 ou 5...) en 2024 remontent pour celles citées dans les réponses IA.

J'ai ma petite idée du pourquoi du comment. Mais pour ceux qui veulent performer dans les IA, il va falloir revoir le temps de réponse du chargement des pages. GG en a souvent parlé mais maintenant, je suis assez persuadé que les temps de réponse et d'affichage d'une première page (j'insiste sur le 'première') deviennent importants (cf. les Core Web Vitals). Les CMS type WordPress qui chargent 25 fichiers Script et CSS vont se faire mettre dehors pour les réponses IA, justement à cause de la charge serveur que l'IA GG impose. D'ailleurs, c'est un constat actuel et juste pour l'instant, je ne trouve aucun site WP dans les réponses IA dans les domaines qui m'intéressent en recherche (biologie au sens large).

Je n'ai jamais "travaillé" spécifiquement pour les robots et encore moins pour les IA (de toute façon, reprendre un site de 25000+ pages, on oublie!) mais toujours pour le visiteur.

Au passage, je kiffe le terme "Raisonnement" exposé par GG le temps qu'il génère la réponse IA... c'est assez drôle.:rolleyes:
 
WRInaute occasionnel
anemone: je suis d'accord avec toi pour la dimension technique de wordpress, et je suis en train de travailler sur un site modeste sur les auteurs des articles de blogs et leurs compétences, car les IA ont besoin de sources de savoirs fiables pour voir si ça influe sur le trafic, comme le site a été fait par quelqu'un d'autre je n'ai pas accès au serveur et je suis novice sur wordpress donc j'avoue que je n'arrive pas à voir les logs serveurs pour voir l'intensité du crawl ou pas...et j'imagine qu'en plus qu'il doit être sur un serveur partagé, donc un peu inquiète...

Moi ce que je n'arrive pas à comprendre c'est les questions de colonies? car finalement ce qu'on cherche c'est du trafic et du clic...car depuis mon expérience d'être hyper crawlée et avoir pleins d'impression, la difficulté n'est ni l'indexation ni l'exploration mais plutôt le clic et l'identification du trafic et des requêtes quand ça vient de l'IA car pour ma part ce trafic apparait en direct sur mes url longues d'articles de blog (je suis sur un .com et un site trilingue)....
 
Nouveau WRInaute
Bonjour,

Le point rassurant d'abord : une explosion du crawl sans variation du trafic, sur un nombre de pages qui reste stable, c'est le scénario typique d'une vague de re-crawl d'actualisation, pas de découverte. Google a besoin de revérifier régulièrement les URL qu'il réutilise dans ses réponses IA pour ne pas y servir une info périmée. @EUSKAL CONSEIL a raison sur le fond, et @colonies a eu le bon réflexe d'écarter une multiplication d'URL parasites.

Avant de chercher à freiner le bot, deux vérifications qui changent tout.

1. Est-ce vraiment Googlebot ? La vague IA s'accompagne d'une explosion de faux Googlebot (scrapers qui usurpent le user-agent). Comme tu as accès au serveur, un reverse DNS des IP sur googlebot.com / google.com puis un forward DNS de contrôle tranchent en deux minutes. Et surtout, le rapport Statistiques d'exploration de la Search Console (Paramètres, Statistiques sur l'exploration) est la source de vérité : il ventile le crawl par objectif (Actualisation vs Découverte) et par type de Googlebot. Si c'est bien 55 000/jour en Smartphone / Actualisation, l'hypothèse re-crawl tient.

2. Regarde la colonne Par réponse de ce même rapport. C'est là que se joue la charge serveur, et c'est le levier que personne n'a encore cité : si ces 55 000 requêtes reviennent en 200 sur des pages inchangées, ton serveur régénère 55 000 pages pour rien. Si ton WordPress renvoie correctement Last-Modified / ETag et répond 304 Not Modified quand le contenu n'a pas bougé, Googlebot revérifie la fraîcheur quasi gratuitement (aucun corps transféré). Faire basculer une partie de ces 200 en 304 (cache HTTP et plugin de cache bien réglé, en évitant que WordPress réponde 200 systématiquement) peut diviser la bande passante et la charge PHP sans rien perdre côté indexation ni citation IA.

À éviter en premier réflexe : bloquer ou ralentir le bot. L'ancien limiteur de vitesse d'exploration de la Search Console a été retiré par Google (début 2024) ; le seul levier restant pour calmer un crawl trop agressif est de renvoyer des 429/503 avec un en-tête Retry-After sur une fraction des requêtes, mais c'est un dernier recours (risque de désindexation si ça dure) et un mauvais calcul si ce crawl vient justement de ta présence dans les réponses IA. Mieux vaut rendre le re-crawl bon marché (304) que de fermer la porte.

Une question : dans ton rapport Statistiques d'exploration, la répartition Par réponse est majoritairement en 200, ou une bonne part passe déjà en 304 ? C'est ça qui dira si le problème est réellement la charge serveur, ou surtout une ligne impressionnante dans un graphe.

Etienne
 
WRInaute passionné
@etienneaubry : heu... les données viennent de GSC, donc on va quand même supposer que ce sont les robots de GG pour les données. De plus, ça persiste et c'est vraiment lié au passage aux résultats IA. C'est monté à 70 000/jour depuis 3 jours. Je n'ai aucune intention de bloquer ou ralentir les bots (officiels et quels qu'ils soient)...

Ca fait plus de 20 ans que je fais du SEO, avec un site qui a fait (au passé) 2 millions de VU/mois, on va dire que je ne suis pas un novice et que je sais lire un rapport de GSC. :p Les dates LastModified ou autres sont gérées valablement (d'ailleurs GG affiche bien la date de création pour chaque page dans ses résultats = preuve qu'il a confiance dans ce paramètre).

Mon site n'est pas basé sur WordPress... (c'est du perso).

Au passage, le 304, c'est sur du statique, comme les images ou pdf par exemples, jamais sur une page HTML. C'est la norme ISO je sais plus quoi.
 
WRInaute occasionnel
Bonjour à tous,

Juste avant de partir en vacances sans ordi, je vous confirme ce qui se dit : quand notre système est utilisé par l'écosystème IA de Google, on subit un grand nombre de crawls quotidiens (de Google, mais pas seulement). On peut très vite se faire bombarder de requêtes.

Pour contextualiser un peu mon cas (petit bémol) : je travaille sur un builder fermé à architecture plate, donc je n'ai aucune possibilité d'optimisation SEO classique via des plugins type Yoast ou RankMath. En revanche, dans mes JSON, je définis entre autres tous les embeddings.

Résultat : mes contenus ne correspondent pas seulement à la réponse stricte d'une requête, mais ils sont absorbés pour pouvoir être utilisés par l'IA dans de multiples autres contextes. D'où la gourmandise des bots !

Bonnes vacances à ceux qui en prennent !

Lydie
 

➡️ Offre MyRankingMetrics ⬅️

pré-audit SEO gratuit avec RM Tech (+ avis d'expert)
coaching offert aux clients (avec Olivier Duffez ou Fabien Faceries)

Voir les détails ici

coaching SEO
Discussions similaires
Haut