Votre tableau de bord affiche un nombre. Douze pour cent de part de voix. En hausse de trois points depuis le mois dernier. Un joli graphique, une flèche verte, un commentaire qui parle de progression.
Vous vous sentez informé. Vous ne l’êtes pas.
Le problème n’est pas que l’outil mente. Le problème est qu’il vous montre un tirage unique d’une variable aléatoire, et qu’il l’appelle une mesure.
Cet article explique pourquoi la même question posée deux fois ne donne pas la même réponse, ce que cela invalide dans les rapports du secteur, et le protocole minimal qui rend une mesure défendable.
Le principe : une distribution, pas un point
Un travail publié le 8 avril 2026 formule le problème sans détour. La visibilité en recherche générative doit être traitée comme une distribution, pas comme un point. Une observation unique n’est pas fiable.
Marquage de provenance : préprint arXiv, sans relecture par les pairs, appuyé sur des mesures empiriques de la variance entre passages successifs.
La formulation paraît technique. Elle ne l’est pas. Elle dit qu’un moteur génératif interrogé deux fois de suite sur la même question ne cite pas les mêmes sources, et que l’écart entre les deux réponses n’est pas une anomalie : c’est le fonctionnement normal du système.
Un moteur de recherche classique est déterministe à court terme. Vous êtes en troisième position, vous y êtes pour tout le monde, vous y serez encore dans une heure. Un moteur génératif ne fonctionne pas ainsi. Il échantillonne. Il compose. Deux exécutions identiques produisent deux réponses différentes, avec des sources différentes.
Mesurer une fois, dans ces conditions, revient à lancer un dé et à noter le résultat comme si c’était la valeur du dé.
Ce que les audits révèlent, et que les rapports ne montrent pas
Le survey critique de juillet 2026 a examiné les audits publiés par les acteurs commerciaux du secteur, en plus des travaux universitaires. Il en tire trois constats convergents, et tous les trois sont gênants.
Le recouvrement des sources est faible. Deux outils interrogeant le même moteur sur la même question ne rapportent pas les mêmes sources citées. Si vos deux prestataires vous donnent des résultats différents, l’explication la plus probable n’est pas la malhonnêteté : c’est que le système ne produit pas deux fois la même chose.
La variabilité d’un passage à l’autre est substantielle. Ce n’est pas un bruit de fond marginal autour d’une valeur stable. L’écart peut dépasser l’ampleur des variations que votre prestataire vous présente comme des résultats.
Les écarts de fidélité persistent. Ce que la réponse affirme n’est pas toujours soutenu par la source qu’elle cite, même quand la source est correcte et pertinente.
L’ordre de grandeur de la volatilité
Une analyse publiée en novembre 2025 donne une idée concrète de l’instabilité, à une échelle qui écarte l’hypothèse du hasard local.
Son protocole : plus de 230 000 prompts, plus de cent millions de citations relevées, sur trois moteurs, avec des relevés hebdomadaires du 14 juillet au 12 octobre 2025. Provenance : éditeur d’outil SEO, méthodologie et fenêtre de mesure publiées.
Le résultat marquant concerne un seul domaine, mais il est spectaculaire. Reddit était cité dans près de 60 % des réponses de ChatGPT au début du mois d’août. À la mi septembre, ce taux était retombé à environ 10 %.
Six semaines. Cinquante points.
Aucune action d’aucun éditeur n’explique cela. C’est une modification de la plateforme, invisible, non annoncée, et qui a redistribué la visibilité de millions de pages. Si votre rapport de septembre montrait une chute, ce n’était pas votre stratégie.
Un dernier élément achève de compliquer la mesure. Un travail de mai 2026 portant sur 761 495 paires de citations établit que 88 à 96 % de la variance de qualité s’explique par le fournisseur, pas par le modèle. Autrement dit : mesurer un moteur ne vous dit à peu près rien de ce qui se passe sur les autres.
Ce que votre rapport affiche, et ce qu’il faudrait
| Ce que montre un rapport GEO courant | Ce que cela vaut | Ce qu’il faudrait |
|---|---|---|
| Une part de voix mensuelle | Un tirage unique | Une moyenne sur mesures répétées, avec dispersion |
| Une requête par intention | Sensible à la formulation | Plusieurs paraphrases de la même intention |
| Une évolution mois sur mois | Confond votre action et les changements de plateforme | Un groupe de contrôle de pages non touchées |
| Un comptage automatique de mentions | Ne lit pas ce qui est dit de vous | Une validation humaine sur échantillon |
| Un seul moteur mesuré | Non transférable : la variance est surtout entre fournisseurs | Une mesure par plateforme, non agrégée |
| Aucune mention des concurrents actifs | Ignore l’interférence entre optimiseurs | Une prise en compte des acteurs qui optimisent en même temps |
Chaque ligne de la colonne de gauche est courante dans les livrables vendus aujourd’hui. Chaque ligne de la colonne de droite figure dans le protocole recommandé par la littérature.
Le protocole minimal, en cinq exigences
Le survey de juillet 2026 propose un protocole reproductible. Il tient en cinq points, et ils ne sont pas négociables si l’on veut affirmer quelque chose.
Mesures répétées. Poser la même question plusieurs fois, et travailler sur la distribution obtenue.
Paraphrases. Formuler la même intention de plusieurs façons, parce que la réponse change avec la formulation, et que vos clients ne parlent pas tous pareil.
Groupe de contrôle. Des pages comparables que vous ne touchez pas, pour distinguer votre effet des mouvements de plateforme. Sans cela, vous attribuerez à votre travail la chute de Reddit de septembre.
Validation humaine. Lire un échantillon des réponses, pas seulement compter les occurrences. Une mention peut être fausse, négative, ou porter sur un concurrent que le comptage attribue mal.
Interférence multi acteurs. Tenir compte du fait que vos concurrents optimisent en même temps. C’est ce qui fait que le gain individuel d’une stratégie GEO s’effondre en marché concurrentiel.
Combien de mesures faut il, exactement
Ici, une réserve s’impose, et elle illustre le sujet de cet article.
Des chiffres précis circulent : il faudrait entre quarante et cent cinquante exécutions pour obtenir un intervalle de confiance serré, ou encore le recouvrement des sources entre deux réponses identiques serait d’environ 21 %. Ces nombres sont plausibles et cohérents avec le reste du dossier.
Je n’ai pas pu remonter à leur source primaire. Ils apparaissent dans des billets d’éditeurs d’outils qui ne publient pas le protocole dont ils sont issus.
Le principe, lui, est solidement établi par un travail dont la méthode est publiée : une mesure unique ne vaut rien. Le nombre exact d’exécutions nécessaires ne l’est pas, et je préfère vous le dire que vous fournir un chiffre rond qui aurait l’air d’une preuve.
C’est exactement le tri qu’il faut appliquer à tout ce qu’on vous présente sur ce sujet.
Ce que vous faites demain matin
Ouvrez votre dernier rapport GEO et posez cinq questions à celui qui l’a produit.
Combien de fois chaque requête a t elle été exécutée ? Si la réponse est une, le reste du rapport n’a pas d’interprétation.
Quelle dispersion observez vous entre les exécutions ? S’il n’y a pas de dispersion communiquée, c’est qu’il n’y a pas eu de mesures répétées.
Quelles pages servent de groupe de contrôle ? Sans contrôle, vous ne pouvez pas distinguer votre effet d’un changement de plateforme.
Quelle part des réponses a été lue par un humain ? Un comptage de mentions ne dit rien de ce qui est dit.
Et les résultats sont ils agrégés entre plateformes ? Si oui, demandez le détail : la variance est principalement entre fournisseurs, une moyenne cache l’essentiel.
Un prestataire sérieux répondra à ces cinq questions sans se braquer, parce qu’il se les est déjà posées. Un prestataire qui vend un chiffre mensuel changera de sujet.
Un nombre affiché avec une décimale n’est pas une mesure. C’est un nombre affiché avec une décimale.
Sources
- Schulte, J., Bleeker, M. & Kaufmann, P. (2026). Don’t Measure Once: Measuring Visibility in AI Search, arXiv:2604.07585
- Martinez, O. (2026). Optimizing Visibility in Generative Engines: A Critical Survey of GEO (2023-2026), arXiv:2607.14035
- Semrush (2025). The Most-Cited Domains in AI: A 3-Month Study
- Seo, Y. et al. (2026). Verified Misguidance: Measuring Structural Citation Failures in Search-Augmented LLMs, arXiv:2605.28565
- Vishwakarma, R., Kumar, S. & Jamidar, R. (2026). What Gets Cited: Competitive GEO in AI Answer Engines, arXiv:2605.25517
- Chu, X. & Hou, Y. (2026). Incumbent Advantage, arXiv:2606.17443
<strong>LaFactory</strong> mesure la visibilité IA avec un protocole publié : mesures répétées, paraphrases, groupe de contrôle. Pas de position garantie, jamais. Contactez nous pour cadrer un audit.