Blig !

Arrêter de deviner : mes expérimentations SEO du moment

Logs de crawl, robots d’IA bloqués par erreur, pages en série qui ne convertissent pas : trois expérimentations menées sur un site neuf, et ce qu’elles m’apprennent sur l’écart entre ce qu’on publie et ce que Google voit.

Depuis quelques mois, j’utilise l’un de mes projets-laboratoires expérimentaux , AuPair Connect, comme terrain de jeu SEO. Un site neuf, plus de 500 pages en sept langues, et une règle : arrêter de deviner, mesurer.

Cet article ne parle pas du produit, mais de ce que ces expériences m’ont appris. Petit avertissement : le site est jeune et les volumes sont modestes (quelques centaines d’impressions par jour). Ce sont des ordres de grandeur, pas des lois.

Expérience n°1 : lire les logs plutôt que se raconter des histoires

L’hypothèse. Quand je corrige un titre ou un maillage interne, Google s’en aperçoit dans les jours qui suivent.

Le test. J’ai branché les journaux de l’hébergement dans BigQuery et regardé qui vient réellement lire mes pages.

Le résultat. Googlebot lisait environ cinq pages HTML par jour. Sur trois jours et demi, 19 pages distinctes. Autrement dit, la plupart de mes corrections restent invisibles pendant des semaines.

Autre découverte moins glamour : à chaque déploiement, les anciens fichiers CSS et JavaScript disparaissent. Googlebot, qui garde en mémoire l’ancienne version de la page, tombe alors sur des 404 en essayant de l’afficher.

Ce que j’en retiens. Avant de mesurer l’effet d’un changement SEO, il faut vérifier que Google a relu la page. Sans ça, on attribue à une correction ce qui relève du hasard, ou du calendrier de crawl.

Expérience n°2 : quand le CDN contredit le robots.txt

L’hypothèse. Mon robots.txt autorise explicitement tous les robots d’IA (GPTBot, ClaudeBot et les autres). Donc ils passent.

Le test. J’ai placé Cloudflare devant le site. Le lendemain, j’ai regardé les logs.

Le résultat. GPTBot, ClaudeBot et Bytespider avaient disparu. Un simple curl avec leur identité renvoyait un 403 « Your request was blocked », y compris sur robots.txt et llms.txt. Le coupable : les réglages « AI bot policies » de Cloudflare, avec la catégorie « Training » sur Disallow. Les robots de recherche et d’agents passaient, mais pas ceux d’entraînement.

J’ai basculé le réglage. En 26 heures, ClaudeBot (43 requêtes), Amazonbot (30), GPTBot (10) et Bytespider (9) étaient de retour, tous en 200.

Ce que j’en retiens. Le robots.txt exprime une intention, mais c’est le réseau qui décide. Que tu veuilles laisser les IA s’entraîner sur ton contenu est un autre débat, légitime. L’important est que la configuration reflète ton choix, et seuls les logs le prouvent.

Expérience n°3 : douze pages de villes, peu de visiteurs

L’hypothèse. Un gabarit de page par ville (« au pair à Lyon », « à Bordeaux »…) capte la demande locale, et on pourra le décliner à l’infini.

Le test. Douze pages en français, pensées pour les familles.

Le résultat. Sur 28 jours : 359 impressions, mais très peu de visiteurs. Pendant ce temps, les mêmes villes dans d’autres langues, avec un gabarit plus ancien, plus court et pensé pour les candidates étrangères, cumulaient 738 impressions et un trafic bien plus réel.

La différence ne vient pas du gabarit, mais de la requête. En français, « au pair + ville » met la page face à des agences, des annuaires et des groupes installés depuis des années. Dans les autres langues, la concurrence est bien plus faible.

Ce que j’en retiens. Ce qu’on teste n’est pas un gabarit, mais la rencontre entre un gabarit, un lecteur et une page de résultats. J’ai donc mis en pause la duplication sur d’autres villes, tant que ça ne convertit pas.

Le pari inverse : une donnée que personne d’autre n’a

En parallèle, je teste l’idée contraire : au lieu de produire plus de pages, produire une page qu’on ne trouve nulle part ailleurs. J’ai publié un baromètre du coût de la garde d’enfant, qui compare crèche, assistante maternelle et au pair selon les villes, avec des sources datées et un jeu de données ouvert.

L’hypothèse : une donnée citable attire plus de liens et de citations qu’une page de plus. Pour l’instant, le baromètre est indexé, et il est trop tôt pour dire quoi que ce soit sur les liens.

Ce que je retiens

  1. Mesurer ce que Google voit, pas ce qu’on publie. Les logs valent mieux que l’intuition.
  2. Vérifier la chaîne technique contre l’intention. Le CDN, le pare-feu et le robots.txt doivent dire la même chose.
  3. Tester la rencontre gabarit, lecteur et SERP avant de dupliquer à grande échelle.
  4. Parier sur ce que personne d’autre n’a plutôt que sur plus de pages.
Quitter la version mobile