Avis sur mon moteur de recherche français indépendant - RDTvlokip Search

WRInaute discret
20 pages ! ok donc pas la peine de soumettre alors, j'ai des sites à plus de 500.000 pages...
Ils sont basés sur la long train.
 
WRInaute discret
Bon, votre message initial était de donner un avis.

Je ne sais pas quel est le but de votre moteur, se développer pour devenir un concurrent ou juste un exercice de style ?

  • Vous avez beaucoup de difficultés a crawler les sites, il faut que le propriétaire fasse beaucoup de manip et sacrifie un peu de sécurité pour être crawl.
  • Vous ne prenez qu'un nombre de pages très restreint
  • Vous ne référencez pas le nom de domaine.

Je ne pense pas qu'en l'état, de nombreux webmasters se bousculent pour soumettre, sans compter que vous devriez référencer sans avoir à soumettre.

Le chemin est encore long si vous voulez concurrencer les moteurs alternatifs, je ne parle même pas des grands.

Bon courage.
 
WRInaute discret
Bon, votre message initial était de donner un avis.

Je ne sais pas quel est le but de votre moteur, se développer pour devenir un concurrent ou juste un exercice de style ?

  • Vous avez beaucoup de difficultés a crawler les sites, il faut que le propriétaire fasse beaucoup de manip et sacrifie un peu de sécurité pour être crawl.
  • Vous ne prenez qu'un nombre de pages très restreint
  • Vous ne référencez pas le nom de domaine.

Je ne pense pas qu'en l'état, de nombreux webmasters se bousculent pour soumettre, sans compter que vous devriez référencer sans avoir à soumettre.

Le chemin est encore long si vous voulez concurrencer les moteurs alternatifs, je ne parle même pas des grands.

Bon courage.
Vous avez raison sur tous les points, le chemin est long. C'est un projet personnel, j'ai 20 ans, pas encore une alternative sérieuse aux moteurs établis. Les limites que vous citez sont connues et sur la roadmap. L'objectif n'est pas de concurrencer Google demain, mais de construire quelque chose d'indépendant et honnête, étape par étape.

Merci pour le retour direct.
 
WRInaute discret
Je suis conscient des limitations, elles sont toutes sur la roadmap. Ce que vous ne voyez pas c'est que derrière il y a :

  • +20 000 lignes de code from scratch, zéro framework de moteur de recherche
  • Un crawler qui a indexé 126M+ de backlinks
  • Un algorithme de ranking à 22 signaux maison
  • Un modèle BERT-like entraîné pour la désambiguaïsaïson sémantique
  • Une infrastructure entièrement auto-hébergée, zéro dépendance Google ou Bing
  • Un audit de sécurité avec ~25 vulnérabilités trouvées et corrigées
  • Tout ça en solo, à 20 ans, en parallèle d'une formation TSSR

Les 20 pages par site et les difficultés de crawl Cloudflare sont des étapes, pas des limites définitives. Le projet a quelques mois, pas quelques années. Le chemin est long, je l'assume, mais il avance.
 
WRInaute discret
Les limitations que vous citez sont réelles et je ne les nie pas. Mais construire un moteur de recherche from scratch, sans framework, sans API Google ou Bing, c'est plus complexe que ça en a l'air.

La plupart des gens pensent que c'est juste du web scraping. En réalité c'est de la gestion mémoire, des systèmes distribués, du NLP, de la sécurité, de l'infrastructure... J'ai vécu chaque problème en vrai, les OOM, les blocages Cloudflare, les vulnérabilités de sécurité, les choix d'architecture. Pas lu dans un article, vécu.

Les 20 pages et les difficultés de crawl sont des étapes, pas des limites définitives. Le projet a quelques mois. Le chemin est long, je l'assume.
 
WRInaute discret
J'ai vu pour mes 2 sites, c'est du bon boulot.

Pour en revenir à l'objet de cette discussion, essayez de changer la page d'accueil, il faudrait réduire ces caractères immenses.

C'est toujours une aventure de tenter de faire quelque chose là où un concurrent occupe une position de quasi monopole. Car c'est bien ce qu'a réussi le Gogol. Tout le monde le dit, la plupart le déplore mais rien ne bouge parce que les gens sont devenus dépendants.

Il existe évidemment une catégorie de sites – les miens par exemple – sans enjeu économique et pour lesquels le dédain du Gogol n'affecterait que l'ego, pas le portefeuille. Mais le Gogol est assez finaud (et a les épaules assez larges) pour ne négliger personne et même des gens comme moi lui font les yeux doux. Perso, j'agis à ma façon pour prendre du recul par rapport à ce monde-là. J'ai définitivement viré Matomo de mon site de poésie parce que je me f... éperdument de savoir qui vient et pourquoi. Je l'ai installé (Matomo) sur le site de Laurel & Hardy mais c'est provisoire, je suis juste curieux de voir le comportement des visiteurs. Dans quelques mois, nul doute que je le supprimerai.

Je suis probablement une sorte de doux rêveur mais il en faut. Je n'ai pas de téloche, pas de radio et la Toile est pour moi comme une façon de jeu. Les aspects techniques m'intéressent car j'aime apprendre mais je ne vais pas au-delà d'un certain seuil ; arrivé là, je retourne à mes poèmes ou je regarde un court-métrage des deux compères.

Bonne continuation. Je redonne mes suggestions : revoir la page d'accueil avec ses caractères gigantesques et virer tous les vocables anglo-saxons qui rendent le discours obscur pour les non-initiés. Le reste, c'est de la patience, beaucoup de boulot et un brin de folie. Car il faut être un peu timbré pour s'attaquer à ce genre de projet. Moi, j'aime bien les gens un peu timbrés... soit dit sans offense.

À plus.
 
WRInaute discret
J'ai vu pour mes 2 sites, c'est du bon boulot.

Pour en revenir à l'objet de cette discussion, essayez de changer la page d'accueil, il faudrait réduire ces caractères immenses.

C'est toujours une aventure de tenter de faire quelque chose là où un concurrent occupe une position de quasi monopole. Car c'est bien ce qu'a réussi le Gogol. Tout le monde le dit, la plupart le déplore mais rien ne bouge parce que les gens sont devenus dépendants.

Il existe évidemment une catégorie de sites – les miens par exemple – sans enjeu économique et pour lesquels le dédain du Gogol n'affecterait que l'ego, pas le portefeuille. Mais le Gogol est assez finaud (et a les épaules assez larges) pour ne négliger personne et même des gens comme moi lui font les yeux doux. Perso, j'agis à ma façon pour prendre du recul par rapport à ce monde-là. J'ai définitivement viré Matomo de mon site de poésie parce que je me f... éperdument de savoir qui vient et pourquoi. Je l'ai installé (Matomo) sur le site de Laurel & Hardy mais c'est provisoire, je suis juste curieux de voir le comportement des visiteurs. Dans quelques mois, nul doute que je le supprimerai.

Je suis probablement une sorte de doux rêveur mais il en faut. Je n'ai pas de téloche, pas de radio et la Toile est pour moi comme une façon de jeu. Les aspects techniques m'intéressent car j'aime apprendre mais je ne vais pas au-delà d'un certain seuil ; arrivé là, je retourne à mes poèmes ou je regarde un court-métrage des deux compères.

Bonne continuation. Je redonne mes suggestions : revoir la page d'accueil avec ses caractères gigantesques et virer tous les vocables anglo-saxons qui rendent le discours obscur pour les non-initiés. Le reste, c'est de la patience, beaucoup de boulot et un brin de folie. Car il faut être un peu timbré pour s'attaquer à ce genre de projet. Moi, j'aime bien les gens un peu timbrés... soit dit sans offense.

À plus.
Merci beaucoup, ça fait plaisir que les sites soient bien crawlés. Je note pour la page d'accueil et les anglicismes, c'est sur la liste. Et oui, il faut être un peu timbré pour se lancer là-dedans. Bonne continuation à vous aussi.
 
WRInaute discret
Beau projet solo.
Petites remarques :
  • Nom mal choisi (difficile à retenir)
  • .fr : pas d'ambition internationale ?

Sur le nom : c'est mon alias depuis des années, cohérent avec mes autres projets (VTT Editor Pro, AG-BPE, etc.). Ce n'est pas optimisé pour la mémorisation grand public, c'est assumé.

Sur le .fr : l'ambition est explicitement française. Un moteur souverain, francophone, indépendant de Google et Bing. Le .fr n'est pas une limitation, c'est une position.
 
WRInaute occasionnel
Oui, mais pour qu'un moteur de recherche soit utilisé par le grand public, il faut que son nom soit mémorisable. En branding et en psychologie cognitive, cela passe généralement par un rythme fluide de deux syllabes et l'utilisation de voyelles claires.

La recherche en neurosciences montre que notre cerveau est soumis à la fluidité de traitement (Processing Fluency) : plus un mot s'articule facilement, plus il inspire confiance et s'ancre dans la mémoire. L'alternance des consonnes et des voyelles crée ce qu'on appelle en marketing le symbolisme phonétique, un levier indispensable pour qu'un utilisateur retienne un nom et le tape spontanément. Un alias technique ou une suite de consonnes complexes sature la mémoire de travail du grand public.

De plus, de nombreuses entreprises françaises exportent. Le web, l'infrastructure technique et le SEO sont massivement financés par le secteur privé et les intentions commerciales des entreprises (comme le rappellent les analyses économiques de la Harvard Business Review). Un positionnement trop restreint géographiquement ou un nom difficile d'accès limitent drastiquement la viabilité et les partenariats publicitaires nécessaires pour éponger les coûts de serveurs.

Ainsi, la réussite et la pérennité de votre projet à grande échelle restent conditionnées par ces deux variables : la mémorabilité cognitive et l'ouverture aux réalités économiques du marché. Et pour que les sites éditeurs se référencent chez vous, il faut que votre moteur de recherche draine du trafic....CQFD....
 
WRInaute discret
Oui, mais pour qu'un moteur de recherche soit utilisé par le grand public...
Merci pour le retour détaillé.

Sur la mémorabilité : point valide, je ne le nie pas. C'est un vrai frein pour l'adoption grand public.

Sur le reste : partenariats publicitaires, viabilité économique à grande échelle ce n'est pas l'horizon actuel. Le projet a quelques mois, 4.5M pages indexées, 288K domaines. L'objectif aujourd'hui c'est de construire un index pertinent et indépendant, pas de monétiser.

Le trafic drainé qui conditionne l'adoption des éditeurs, c'est juste. Mais ça vient après la qualité de l'index, pas avant.
 
WRInaute discret
Un nom vaut mieux le changer au début du projet qu’au milieu…
Changer le nom en cours de route coûte plus cher que le garder. RDTvlokip est cohérent avec tout l'écosystème crawler, projets, alias, etc. La mémorabilité grand public, c'est un problème pour quand le trafic est là. Pas maintenant.
 
WRInaute discret
Je pense aussi que c'est une erreur, tu commences à communiquer sur ton moteur, l'ancienneté du domaine, tout un tas de facteurs qui sont en faveur de bien choisir le nom dès le départ. Tu ne peux pas t'en soucier après la constitution de l'index, il ne sera jamais finis...
 
WRInaute discret
Je pense aussi que c'est une erreur, tu commences à communiquer sur ton moteur, l'ancienneté du domaine, tout un tas de facteurs qui sont en faveur de bien choisir le nom dès le départ. Tu ne peux pas t'en soucier après la constitution de l'index, il ne sera jamais finis...
L'ancienneté du domaine comme signal, c'est un point valide que je n'avais pas considéré.

Mais changer de nom maintenant c'est : nouveau domaine, nouveau crawl de tout l'écosystème (VTT Editor Pro, AG-BPE, tous mes projets liés), reconstruction de la notoriété zéro. Le coût dépasse le bénéfice à ce stade.

Sur "il ne sera jamais fini" : un index ne se finit effectivement jamais, c'est sa nature. Google et Bing non plus n'ont pas d'index fini, ils re-crawlent en permanence parce que le web grossit et change chaque jour. Ça ne change pas l'ordre des priorités.
 
WRInaute occasionnel
Je comprends tout à fait ton point de vue de concepteur et je salue la performance technique : développer tout cela from scratch à 20 ans, en solo, avec la gestion de l'infrastructure et de la sémantique (BERT), c'est un travail colossal et remarquable. Chapeau pour ça.

Cependant, attention à ne pas confondre l'index technique et la marque :

  • Changer de nom ou migrer un domaine ne t'oblige absolument pas à re-crawler tout ton index. C'est un travail de redirection et de base de données, pas un reset de tes serveurs.
  • Plus ton index va grossir et plus tu vas intégrer de projets à ton écosystème, plus le coût de sortie de cet alias sera lourd et douloureux.
L'argument de @Just Aware sur l'ancienneté du domaine est un vrai signal SEO, mais c'est surtout le capital confiance et la mémorisation auprès de tes futurs utilisateurs que tu hypothèques.

Ton projet est une superbe aventure technique. Prends simplement soin de ne pas laisser le "code" bloquer la vision stratégique à long terme. Très bonne continuation pour la suite de ta roadmap !
 
WRInaute discret
Tu peux avoir un crawler sur un domaine et le résultat public sur un autre domaine.
Séparer le technique du commercial peut être bon, techniquement aussi.
Sur un même serveur, tu as accès aux mêmes bases et technique, quel que soit le domaine.
 
WRInaute discret
@Just Aware et @EUSKAL CONSEIL
Je comprends les arguments et ils sont valides dans un contexte de lancement marketing classique. Mais RDTvlokip n'est pas juste un nom de domaine.

C'est un alias lié à un écosystème entier :
  • Publications scientifiques sur Zenodo, ResearchGate, HAL (ORCID : 0009-0009-6643-7372)
  • Projets publiés sous ce nom : AG-BPE, VTT Editor Pro, LISP-7
  • Profils Hugging Face, GitHub, Google Scholar
  • User-Agent RDTvlokipBot validé comme Verified Bot Cloudflare

Séparer le domaine public du crawler ne change rien à ça. Ce n'est pas un problème de redirection 301, c'est une identité technique et académique construite sur plusieurs années.

Sur la mémorabilité : Google s'appelait "BackRub" avant de devenir Google. "Google" lui-même était considéré comme un nom bizarre en 1998. C'est l'usage qui crée la mémorabilité, pas l'inverse.
 
Olivier Duffez (admin)
Membre du personnel
Si ce projet vise une adoption par le grand public, ça me semble tout de même incontournable d'avoir un nom que l'on retient. Est-ce que au moins une personne ici saurait épeler le nom correctement ?
 
WRInaute discret
Si ce projet vise une adoption par le grand public, ça me semble tout de même incontournable d'avoir un nom que l'on retient. Est-ce que au moins une personne ici saurait épeler le nom correctement ?
C'est une critique légitime pour un moteur visant le grand public.

Mais le projet n'en est pas là. Aujourd'hui l'objectif c'est la qualité de l'index, pas l'adoption massive. La question du nom se posera vraiment quand le trafic sera là.

Sur l'épellation : RDTvlokip se prononce R-D-T-vlo-kip. Ceux qui me suivent l'épellent correctement. Les autres disent RDT trois lettres, aussi simple que SFR ou EDF.

C'est un vrai sujet à long terme. Pas la priorité aujourd'hui.
 
WRInaute occasionnel
Bon de toute manière la migration dont je parle visait à créer une interface pour les utilisateurs et éditeurs tout en gardant ce que Tu avais déjà fait, donc les blocages au niveau du changement de nom de marque tombent....je comprends tes blocages et moi même serai terrifiée s"il fallait que je fasse de même avec mon nom de domaine auquel je ne suis pas tant attachée, mais la seule différence c'est que je ne vise pas l'adoption du grand public....même si a priori les gens tapent facilement euskal conseil sur google, je suis la première surprise....
 
Nouveau WRInaute
RDTVLOKIP c'est bon je l'ai en tête et pourtant j'ai une mémoire de poisson o_O

Bon, heu, https://search.rdtvlokip.fr/search?q=photo

Ya moyen de mettre les sites persos ou amateurs en haut du tableau ;) ? Marre des gros sites commerciaux ils sont partout !

Quel râleur je suis ^^ Sinon très beau projet ! J'aime beaucoup ce type d'interface graphique à la fois à l'ancienne et moderne quand même.

Qwant​

  • ✗Utilisent l'index de Bing/Google
Il y a pas eu des changements à ce sujet pour Qwant ?
 
Dernière édition:
WRInaute discret
RDTVLOKIP c'est bon je l'ai en tête et pourtant j'ai une mémoire de poisson o_O...
Content que ça reste en tête malgré la mémoire de poisson, ça me va droit au cœur :)

Pour mettre les sites perso/amateurs en avant : c'est exactement l'esprit du projet, mais ce n'est pas encore un signal actif dans mon algorithme de ranking (22 signaux pour l'instant). Bonne idée à creuser, je la garde de côté. Détecter proprement un site perso (pas de boutique en ligne, peu de pub, structure simple) demande du travail mais c'est faisable.

Pour Qwant : ça a bougé récemment. Ils étaient historiquement complétés par l'index Bing, mais Qwant et Ecosia viennent de lancer ensemble un nouvel index européen (Staan) via leur coentreprise EUSP, justement pour sortir de cette dépendance. Ça reste une transition en cours, pas un index maison depuis le départ comme ici ou chez Mojeek, mais le mouvement est réel.

Merci pour le retour, ça fait plaisir !
 
Nouveau WRInaute
Bonjour,

J’ai testé quelques requêtes très simples : "Victor Hugo", "Michael Jordan" et "Le Bourgeois gentilhomme".

Pour ce type de recherche, les premiers résultats ne correspondent pas encore vraiment à ce que l’on attendrait. Sur le nom d’une personnalité, on s’attend généralement à trouver rapidement une biographie ou une page encyclopédique de référence. Pour une œuvre littéraire, on attend plutôt sa présentation, un résumé, le texte (ebook téléchargeable si dans le domaine public) ou une fiche pédagogique.

Cela semble indiquer un problème de reconnaissance de l’intention ou des entités recherchées, mais peut-être aussi de couverture de l’index et de classement des sources faisant autorité.

Aussi, à prendre en compte : beaucoup de requêtes courtes sont "paradoxalement" plus complexes, car elles peuvent être ambiguës. Par exemple, "rose" peut désigner une fleur, une couleur, un prénom ou une personnalité (rose mcgowan par ex), une rose des sables (roche ou pâtisserie), une rose des vents... Autre exemple : "martinet" peut désigner un oiseau, un petit fouet ou une machine.
Il serait donc intéressant que le moteur identifie les différents sens possibles et diversifie les premiers résultats, plutôt que de privilégier uniquement les pages contenant exactement les mots recherchés.
 
Dernière édition:
WRInaute occasionnel
App Ergo ton intervention est légitime et sur les personnes on attend aussi à avoir une image...mais ce n'est pas pour rien que Google est si réticent à partager son Knowledge graph qui a mis tant de temps à s'établir, ce n'est pas pour rien que chez Google quand des vecteurs sont attribués à une entité il est difficile qu'une autre les prenne, car un tel investissement c'est des années de recherche....n'ayant pas la serach console de Théo je ne peux juger mais à mon niveau et en ayant pratiqué le seo d'entités, je peux vous assurer que le moteur de recherche google n'est pas sur un mot clé mais sur des vecteurs mathématiques et tant qu'il n'a pas vérifié la correspondance exacte et la stabilité de ses vecteurs pour une entité il continue de produire une floppée de mots clés et des positions que vous appeliez dans le "old seo" des positions fantômes....si vous aviez accès à ma search console et que vous la compariez à un vieux site wordpress non dépucelé sémantiquement vous seriez surpris de voir la dichotomie entre le flux de mots clés et de recherche de mon site et celui de ce site wordpress dont je m'occupe....Mais Théo n'a pas les mêmes moyens financiers ni humains (quantitatifs) pour espérer atteindre ce que Google a mis des années à affiner en gardant le même objectif en tête.... ;)
 
WRInaute discret
Bonjour,

J’ai testé quelques requêtes très simples : "Victor Hugo", "Michael Jordan" et "Le Bourgeois gentilhomme"...
Bonjour,

Sur Victor Hugo et Michael Jordan, tu as trouvé un vrai problème, mais pas celui auquel tu penses probablement. Je limite actuellement le crawl à 20 pages par domaine pour des raisons de stockage. Wikipédia a des millions d'articles : avec ce cap, la bio de Victor Hugo n'est presque sûrement pas dans mon index.

Ce n'est donc pas un problème de reconnaissance d'entité, c'est un problème de couverture. Je travaille justement sur une profondeur de crawl variable selon l'autorité du domaine, les sites de référence type Wikipédia auront bien plus que 20 pages.

Sur l'ambiguïté (rose, martinet) : problème différent et plus dur. Mon modèle de désambiguïsation sémantique s'applique surtout au contenu des pages indexées, pas encore à l'intention de la requête elle-même. Diversifier les résultats selon les sens possibles d'un mot, c'est sur ma liste, pas encore résolu.

Merci pour le retour précis, c'est exactement ce type de test qui m'aide.
 
WRInaute discret
App Ergo ton intervention est légitime et sur les personnes on attend aussi à avoir une image...
Tu as raison sur le Knowledge Graph : répliquer ça, avec des années de curation d'entités et des vecteurs sémantiques affinés, c'est hors de portée à mon échelle, seul, sans les moyens de Google.

Mais le problème qu'AppErgo pointe (Victor Hugo, Michael Jordan) n'a pas besoin d'un Knowledge Graph pour être en grande partie résolu. C'est surtout un problème de profondeur de crawl : je limite actuellement à 20 pages par domaine, donc un site comme Wikipédia n'est indexé qu'à la marge. Une meilleure priorisation du crawl sur les domaines de référence couvre une bonne partie du problème, sans vecteurs sémantiques à la Google.

L'ambiguïté des requêtes courtes (rose, martinet), en revanche, c'est plus proche de ce que tu décris, et là je suis d'accord : beaucoup plus dur à résoudre avec mes moyens.

Pour info, j'ai un début de search console de mon côté : clics reçus, position moyenne au clic, par domaine, en données agrégées. Ça reste très modeste vu le trafic actuel du moteur, mais la structure existe déjà.
 
WRInaute occasionnel
Salut Théo il me semblait que tu avais dit aussi que tu avais en plus de la limite du crawl de 20 pages un crawl plus espacé que les autres moteurs de recherche pour ma part j'ai googlebot qui passe tous les jours toutes les 4h, Bing aussi et Baidu régulièrement même si pour ce dernier je n'ai rien fait...sans compter les autres...donc en effet on ne peut pas comparer ton moteur de recherche aux leaders en ce domaine....
 
WRInaute discret
Salut Théo il me semblait que tu avais dit aussi que tu avais en plus de la limite du crawl de 20 pages...
Salut Lydie,

Exact, tu as raison. Aujourd'hui c'est un recrawl uniforme à 30 jours pour tous les domaines, alors que Googlebot ou Bing ajustent leur fréquence selon l'importance et la vitesse de changement de chaque site. On ne joue clairement pas dans la même cour niveau ressources.

Bonne nouvelle : c'est déjà dans ma roadmap. L'idée c'est de passer à un recrawl priorisé par fréquence de changement observée plutôt qu'un seuil fixe pour tout le monde. Pas encore implémenté, mais toutes les briques sont déjà là (dates de publication, détection des changements, score d'importance des pages).

Merci de suivre le projet d'aussi près, ça compte pour moi
 
WRInaute occasionnel
"Pourquoi Googlebot recrawle-t-il massivement des URL dont le contenu n'a pas changé ? Est-ce que le fait d'être sur une architecture Astro couplée à Cloudflare joue un rôle ? J'ai l'impression que la gestion des hashs des fichiers statiques d'Astro lors des déploiements crée une différence majeure par rapport au comportement d'un WordPress...car du coup ça génère une empreinte carbone dans le edge inutile non?
 
WRInaute discret
"Pourquoi Googlebot recrawle-t-il massivement des URL dont le contenu n'a pas changé ? Est-ce que le fait d'être sur une architecture Astro couplée...
Ton hypothèse tient globalement la route...

Googlebot décide de retélécharger toute la page ou d'accepter un simple 304 selon l'ETag ou le Last-Modified. Si le HTML change vraiment à chaque déploiement, même juste dans les balises script/link qui référencent les fichiers hashés, l'ETag change... et Googlebot retélécharge tout en croyant à un vrai changement.

Après petite nuance : le hash d'Astro (comme Vite) est censé être basé sur le contenu du fichier, pas sur la date de build. Si ton JS/CSS n'a pas bougé, le hash devrait rester identique entre deux déploiements... à condition que le build soit déterministe. Et là beaucoup de pipelines ne le sont pas (timestamp injecté, ordre instable, variables d'environnement embarquées). C'est souvent ça le vrai coupable, plus qu'Astro lui-même.

Sur l'empreinte carbone... le principe est valide, mais à l'échelle d'un site perso ça reste franchement négligeable. C'est plus un sujet à l'échelle de toute l'industrie qu'à l'échelle d'un site.

Et tiens, ça me fait penser... c'est exactement le genre de problème que mon hash de dédup résout de mon côté. Je compare le texte nettoyé, pas le HTML brut, justement pour ignorer ce genre de changements cosmétiques sans vrai contenu différent derrière.
 
WRInaute occasionnel
Merci pour ton retour hyper précis, c'est exactement le genre de détails techniques me font avancer....

Tu mets le doigt sur un point clé : le build non déterministe. Sur l'environnement Astro / Hostinger, je constate en effet que les signatures/hashes des fichiers CSS et JS dans le HTML ont tendance à bouger d'un déploiement à l'autre, même quand le corps du texte ne change pas. Pour le bot (et Cloudflare), l'ETag change, donc il re-télécharge la page en pensant voir une nouvelle version.

Après, il y a un cumul de phénomènes de mon côté :

  1. La réconciliation d'entité : Je suis actuellement dans une phase de rafraîchissement global de mes contenus pour verrouiller la cohérence sémantique de mon entité (alignement SEO/GEO, données structurées JSON-LD).
  2. L'optimisation média : Je retravaille l'ensemble de mes images pour les rendre ultra-légères.
Du coup, une partie de ce re-crawl est totalement voulue et légitime, mais elle vient se superposer au "bruit" technique lié aux builds du CMS/serveur.

À terme, mon objectif est d'aligner la recherche de trafic qualifié avec une vraie démarche de Green SEO. Le choix de l'architecture et la maîtrise de la chaîne de déploiement ont une vraie influence sur l'empreinte carbone au niveau du Edge : éviter qu'un bot ne repasse sur une page pour une simple variation cosmétique de hash d'asset, c'est autant de bande passante et de CPU économisés. C'est chouette que de ton côté tu y penses...c'est vrai qu'à l'échelle d'un site c'est anecdotique mais vu mes logs serveurs si tous les sites avaient ce même type de crawl l'empreinte carbone du digital grimperait de manière invisible pour la plupart des éditeurs de sites pour un trafic qui n'est pas proportionnel au nombre de crawls.....
 
WRInaute discret
Merci pour ton retour hyper précis, c'est exactement le genre de détails techniques me font avancer...
Ton point sur l'effet d'échelle est juste... individuellement ça paraît anecdotique, mais multiplié par des millions de sites avec le même comportement, ça devient un vrai coût invisible. C'est exactement le genre de chose qu'aucun éditeur ne regarde parce que ça ne se voit nulle part dans une facture ou un dashboard.

C'est d'ailleurs un peu la philosophie derrière mon propre projet, même si je ne le formule pas en "Green SEO"... zéro framework, zéro dépendance inutile, HTML nettoyé et compressé avant stockage. Pas par militantisme écologique à la base, plutôt par contrainte de budget serveur... mais au final ça revient un peu au même constat : moins de gaspillage à la source, moins de bruit pour tout le monde.

Bonne continuation sur la réconciliation d'entité, ça a l'air d'être un sacré chantier de ton côté aussi.
 
WRInaute occasionnel
oui mais c'est intéressant d'observer que ce travail paye dans les tests de l'algorithme car il teste désormais par grappe et noeuds d'autorité tout en essayant toujours d'envoyer en même temps du trafic vers mes articles de blogs qui se voyaient naturellement et avaient du succès sans toute cette optimisation technique visant à équilibrer le graph de l'entité de manière alignée avec mon business...ça n'a l'air de rien comme ça mais c'est important...mais je t'avoue développer une offre plus abordable pour les petites entreprises par chez moi, dans ma campagne...et faire ma petite commerciale me fait du bien, car être dans cette sur-optimisation peut parfois me faire oublier que l'idée c'était de faire un peu de business quand même...
 
WRInaute discret
Je redonne mes suggestions : revoir la page d'accueil avec ses caractères gigantesques et virer tous les vocables anglo-saxons qui rendent le discours obscur pour les non-initiés....

Salut Lion ! J'espère que tu vas bien

Pour faire suite à ta suggestion du 19 mai (#108) sur les anglicismes : c'est corrigé depuis presque 2 mois maintenant. Je n'avais pas pensé à revenir te le dire ici, mais c'était sur la liste et c'est fait.

La page d'accueil (caractères trop gros) reste encore à traiter de mon côté.
 
WRInaute discret
Salut Théo.

Pour faire suite à ta suggestion du 19 mai (#108) sur les anglicismes : c'est corrigé depuis presque 2 mois maintenant. Je n'avais pas pensé à revenir te le dire ici, mais c'était sur la liste et c'est fait.

La page d'accueil (caractères trop gros) reste encore à traiter de mon côté.
Excellent !

Puis chaque chose en son temps, tu referas la page d'accueil un peu plus tard. Ça avance, ça avance...
 
WRInaute discret
Salut Théo.

Excellent !

Puis chaque chose en son temps, tu referas la page d'accueil un peu plus tard. Ça avance, ça avance...
Merci, ça fait plaisir de lire ça.

Avant de retoucher la page d'accueil, une question : c'est quoi ta résolution d'écran et ton niveau de zoom navigateur ? Je veux comprendre si les caractères sont vraiment trop gros dans l'absolu, ou si c'est lié à ton ordinateur précis. Ça m'éviterait de changer un design qui serait normal ailleurs.
 
WRInaute discret
C'est certes mieux mais perso, j'aurais encore réduit le lettrage.

Après, ce n'est qu'un seul avis. D'autres sont peut-être contents come ça et par-dessus tout, il y a ta façon de voir la chose. C'est toi qui décides au final sinon ça devient ingérable.
 

➡️ Offre MyRankingMetrics ⬅️

pré-audit SEO gratuit avec RM Tech (+ avis d'expert)
coaching offert aux clients (avec Olivier Duffez ou Fabien Faceries)

Voir les détails ici

coaching SEO
Discussions similaires
Haut