En bref

  • Une nouvelle prépublication retire de la décision de citation les deux explications faciles. Chaque candidat était réel, également visible, et dépouillé de tout signal de statut. Onze modèles de trois fournisseurs ont quand même concentré fortement leurs citations sur le même petit sous-ensemble.
  • Cette concentration relève surtout d’une seule préférence partagée plutôt que de onze préférences distinctes. Une seule composante explique de 68 à 73 % de la variance entre les cartes de préférence des modèles, et des modèles de fournisseurs différents s’accordent entre eux presque autant que des modèles d’un même fournisseur.
  • Changer de moteur n’est donc pas un contournement. Mélanger les modèles de façon uniforme retire 28 % de la concentration excédentaire, et le meilleur mélange pondéré que les auteurs ont pu ajuster en conserve encore 55 %.
  • La préférence suit le sens, pas la formulation. Paraphraser chaque candidat en préservant son contenu a laissé la carte de préférence pratiquement inchangée : la reformulation de surface devient donc du gaspillage mesuré dans le contexte testé. Ça n’établit pas quels changements de fond déplacent la préférence en votre faveur.
  • La portée, sans détour : l’étude mesure la citation scientifique sur un seul sujet, c’est une prépublication, et nous ne l’avons pas reproduite. C’est une preuve de mécanisme pour la couche de sélection, pas une mesure de votre marché. Ce sont nos propres mesures québécoises qui portent le volet marché.

La version de cette question qu’on nous pose le plus souvent vient d’un dirigeant qui a déjà fait le travail. Le site est rapide, les robots sont autorisés à passer, les pages sont indexées, Google envoie du trafic. Puis il pose à ChatGPT ou à Perplexity la question que ses clients posent, et c’est quelqu’un d’autre qui se fait nommer. Il existe maintenant une expérience contrôlée qui isole le mécanisme, et ce n’est pas celui que décrivent la plupart des argumentaires de visibilité IA.

Ce que l’expérience a retiré

La plupart des travaux publiés sur les citations IA auditent la défaillance que tout le monde connaît déjà : des modèles qui inventent des références inexistantes. « When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models » (Alemohammad et coll., 2026, une prépublication qui n’a pas été évaluée par les pairs) pose la question qui commence une fois celle-là réglée. Quand chaque candidat est réel, qu’aucun n’est plus facile à trouver que les autres, et que rien ne signale lequel est prestigieux, le modèle a-t-il quand même ses favoris ?

Ce que le protocole retire est tout l’intérêt de l’exercice. Les auteurs ont pris 120 articles réels sur un même sujet. Chaque requête présentait au modèle un panel de 30 d’entre eux, tiré uniformément au hasard, avec de vrais titres et de vrais résumés, mais avec des auteurs fabriqués, des années réattribuées, et les lieux de publication et les nombres de citations masqués. La récupération est égalisée, puisque chaque candidat est déjà sous les yeux du modèle. Le prestige est retiré, puisqu’il n’y a ni auteur, ni revue, ni compte de citations sur lequel s’appuyer. Puis un budget strict : citer au plus 10 articles. C’est la rareté qui force un choix, et c’est le choix qui rend une préférence visible. Chaque exécution était comparée au même modèle choisissant indifféremment dans le même panel.

Transposez ça dans votre marché et ça se lit comme un contrôle d’une propreté inhabituelle. C’est l’équivalent de placer votre page et celles de neuf concurrents devant un modèle, logos enlevés, domaines masqués, profils de liens entrants invisibles, puis de lui demander laquelle il cite.

Ce qu’elle a trouvé : une concentration que la récupération n’explique pas

Les onze modèles ont tous concentré. Le décile supérieur des articles a capté entre 23,3 et 30,2 % de toutes les citations, contre 15,6 % en sélection indifférente, et des articles sont restés systématiquement non cités sur des dizaines d’expositions distinctes. Un test formel d’échangeabilité a rejeté l’hypothèse d’un sélecteur sans favoritisme pour chaque modèle du panel.

Huit experts du domaine ont jugé des panels identiques à l’octet près, sous le même budget de citation, et leurs choix étaient statistiquement indiscernables d’une sélection indifférente. Deux choses sont vraies là-dedans en même temps, et la lecture honnête exige les deux. Les experts n’ont montré aucune préférence détectable du genre de celle que montrent les modèles. Et l’échantillon d’experts était petit, 53 requêtes dont 41 venant d’un seul annotateur, ce qui explique que les auteurs rapportent un plafond sur toute préférence qui aurait pu leur échapper plutôt qu’une estimation de celle-ci. Ce qui survit est étroit et reste substantiel : cette concentration est une propriété des modèles, pas une caractéristique inévitable du fait de choisir parmi des articles sous contrainte de budget.

Une seule carte, pas onze

Les modèles ne font pas chacun leur affaire dans leur coin, et c’est le constat qui a la conséquence commerciale la plus directe. Une seule composante explique de 68 à 73 % de la variance entre leurs cartes de préférence, et l’accord entre fournisseurs (les familles GPT, Gemini et Claude) rejoint presque l’accord à l’intérieur d’un même fournisseur. Des entraînements différents, des entreprises différentes, largement le même goût.

Ce résultat élimine le contournement auquel la plupart des gens pensent en premier. Si chaque modèle avait sa préférence idiosyncrasique, répartir vos paris sur plusieurs moteurs en ferait la moyenne. Les auteurs ont testé exactement ça. Le mélange uniforme des onze modèles retire 28 % de la concentration excédentaire. Le meilleur mélange pondéré qu’ils ont pu construire par validation croisée en conserve encore 54,6 %, avec un intervalle de confiance à 95 % allant de 48,9 à 60,6 %. La diversité de fournisseurs vous achète la part idiosyncrasique et laisse la part partagée debout, et la part partagée, c’est l’essentiel.

Pour un dirigeant, ça recadre ce que veut dire « on apparaît dans certaines réponses IA et pas dans d’autres ». La variation d’un moteur à l’autre est réelle, et c’est la petite moitié. La grande moitié, c’est une préférence qu’ils ont en commun, qui est soit un consensus absorbé sur ce qui se fait citer, soit un jugement convergent sur ce à quoi ressemble une source citable. L’article laisse cette question ouverte volontairement, et ses résultats tiennent sous l’une comme sous l’autre lecture. L’étude rapporte tout de même un indice partiel de ce sur quoi la carte partagée s’appuie : un indice de centralité méthodologique, construit à partir du titre et du résumé de chaque article, corrèle à 0,54 avec la carte partagée des modèles et à seulement 0,26 avec celle des experts, avec un article de distillation de connaissances à l’extrémité favorisée et un article de détection d’objets 3D à l’extrémité délaissée. Les auteurs le classent comme un corrélat post hoc plutôt que comme l’estimation sur laquelle repose la section, et il explique une partie de la carte, pas la totalité. Lu comme une direction et non comme une consigne, ça dit que les modèles penchent vers ce qui se lit comme méthodologiquement central.

La couche que votre référencement atteint réellement

Ça fait un moment qu’on décrit ici la recherche IA en couches : l’admissibilité, puis la sélection, puis la mémoire. Nos notes de terrain sur le GEO posent le modèle complet, et l’article sur la sélection des citations établit qu’aucun fournisseur ne documente la deuxième couche. Cet article de recherche est la première preuve contrôlée que nous ayons vue de ce que fait cette couche non documentée.

La conséquence pratique, c’est une règle de cadrage. Le travail de première couche est nécessaire, il est peu coûteux à vérifier, et il vous fait entrer dans l’ensemble des candidats, et on en fait la vérification pas à pas dans le mandat SEO de l’IA. Ça ne touche pas la deuxième couche. Un audit qui vous remet une fiche technique toute verte et appelle ça de la visibilité IA a terminé la première couche et laissé la seconde sans examen. Être trouvable et être préféré sont deux problèmes différents, avec du travail différent derrière.

La préférence lit le sens, pas la formulation

Le résultat qui devrait changer un budget de contenu, c’est le test de paraphrase. Les auteurs ont paraphrasé les 120 résumés, assez fort pour que le chevauchement avec la formulation d’origine disparaisse presque (chevauchement de 5-grammes à 0,05 ou moins), tout en gardant le contenu intact. La carte de préférence n’a presque pas bougé : une corrélation de 0,96 à 1,00 avec l’originale, soit le plafond de ce que la mesure elle-même peut départager. Les deux conditions de paraphrase qui ont bel et bien déplacé la carte sont les deux qui changeaient ce que les résumés disaient vraiment, un contrôle intégré qui pointe dans le même sens : le contenu déplace la préférence, la formulation non. Un test croisé a attribué environ 90 % de la variance de la carte d’un modèle au contenu des articles.

Lisez ça à côté de ce qui se vend sous l’étiquette d’optimisation pour l’IA. Réécrire des pages dans un registre « adapté à l’IA », redécouper les paragraphes en morceaux calibrés pour les modèles, remplacer du vocabulaire : ce sont toutes des opérations de surface, et voici une mesure contrôlée d’opérations de surface qui ne font rien. Google dit quelque chose de compatible, par l’autre bout, dans ses propres recommandations sur l’IA : pas de balisage spécial, pas de découpage, pas de style d’écriture propre à l’IA.

L’inverse n’est pas automatiquement vrai. L’expérience montre que des modifications qui préservent le sens ne déplacent pas la préférence. Elle ne montre pas quelles modifications du sens la déplacent en votre faveur, et rien ici ne valide une tactique en particulier. Les paris d’enrichissement que nous avons décrits dans l’article sur la sélection des citations restent des paris. Ce qui change, c’est où se situe le plancher : si un plan consiste surtout à reformuler, il existe maintenant une mesure contrôlée, sur des résumés scientifiques, où ce genre de retouche ne déplace rien.

Ça se resserre à mesure que l’écriture IA inonde le bassin

Les auteurs ont ensuite mené douze cycles successifs où des articles écrits par des modèles entraient dans le catalogue à côté des vrais. La préférence elle-même restait fixe pendant que le bassin grossissait, et deux choses se sont produites en même temps. La part des citations qui revenait aux vrais articles est tombée de la totalité au départ à 15,6 %, et chaque vrai article encore en lice se faisait citer dans une proportion croissante des occasions où il apparaissait : au dernier cycle, les articles d’origine étaient cités dans 63,4 % de leurs apparitions, contre 39,6 % pour la première génération d’articles écrits par des modèles. Une partie de cette trajectoire est mécanique, et les auteurs le disent. Un catalogue plus gros sous un budget de citations fixe se concentre de lui-même, ce qui fait monter le seuil de la sélection indifférente pour le décile supérieur à 29,1 % au dernier cycle. Les modèles franchissent cette barre mobile à chaque cycle, avec des parts de 31,1 à 40,3 %. Le filtre ne s’est pas dilué avec le volume. Il s’est condensé sur moins de cibles.

La portée de ça est étroite : c’est une préférence fixe qui rencontre un corpus grandissant, pas un véritable écosystème de rétroaction, parce qu’une citation à un cycle ne change jamais ce qui sera montré au cycle suivant. La direction reste inconfortable pour quiconque se trouve hors de l’ensemble préféré. À mesure qu’une part croissante du bassin est écrite par des machines, la valeur d’être déjà préféré monte, et le coût de ne pas l’être aussi.

Ce que ça dit de votre entreprise, et ce que ça n’en dit pas

L’article mesure la citation scientifique sur un seul sujet, dans des formats de tâche étroits, en choisissant parmi des articles déjà placés devant le modèle. Il ne dit rien de direct sur les entreprises locales, les mentions de marque ou le contenu commercial. Quiconque le transporte dans un argumentaire marketing est en train d’extrapoler, nous compris, et ça se dit à voix haute plutôt qu’en note de bas de page.

Ce qui se transpose, c’est le mécanisme : une étape de sélection qui se situe au-dessus de la récupération, qui est largement partagée entre les fournisseurs, qui s’appuie sur le contenu plutôt que sur la surface, et qui concentre. Ce qui ne se transpose pas, c’est le moindre chiffre qu’on y trouve. Pour le volet marché, nous utilisons plutôt nos propres mesures. L’étude québécoise la plus large publiée à ce jour (Observatoire Noos, étude #1) a constaté que les PME locales captaient 18 % ou moins des mentions des modèles dans neuf marchés sectoriels sur douze, et notre propre sondage à livre fermé sur la toiture au Québec a vu le panel nommer une entreprise locale vérifiable dans 7,1 % des réponses. Les deux se trouvent dans l’article sur la couche de mémoire, avec leurs réserves attachées. Deux séries de données indépendantes qui pointent dans le même sens, c’est la version honnête de cet argument. Un seul article qui porte tout le poids, non.

Ce que nous en faisons

Trois choses changent dans notre façon de cadrer un mandat, et aucune n’est une promesse.

  • Mesurer avant d’argumenter. Votre position dans les réponses IA est observable : passez les questions que vos clients posent réellement à travers plusieurs modèles, et comptez qui se fait nommer. Une mesure que vous pouvez répéter le trimestre prochain vaut mieux qu’une assurance sur le fonctionnement des modèles, et c’est la base honnête pour décider si cette couche mérite un budget, tout simplement.
  • Investir dans le fond, pas dans la surface. Si une proposition consiste surtout à reformuler, restructurer et baliser, le résultat sur la paraphrase est une raison de demander ce qu’elle est censée changer. Le budget appartient là où le contenu dit quelque chose qu’un modèle aurait une raison de préférer.
  • Ne pas traiter la couverture sur plusieurs moteurs comme une police d’assurance. Être absent d’un moteur est un faible indice qu’un autre vous sauvera, parce que la préférence est majoritairement partagée. Répartissez votre mesure sur plusieurs moteurs, pas vos espoirs.

Le premier des trois est celui sur lequel vous pouvez agir ce mois-ci sans embaucher personne, et c’est aussi par là qu’on commence : le décompte de départ de qui se fait nommer sur vos questions, sur plusieurs moteurs, mis par écrit pour que le prochain trimestre ait quelque chose à quoi se comparer. Cette mesure est le coup d’envoi d’un audit SEO express et ce à partir de quoi on argumente dans un mandat de consultant, et c’est la même posture sous notre travail GEO : réparer la couche documentée en entier, traiter la couche inférée comme inférée, mesurer plutôt que promettre. Ce que personne ne peut vous vendre, c’est une place dans l’ensemble préféré, parce que personne n’a publié le mécanisme qui vous y mettrait.

C’est exactement ça que l’expérience a été construite pour isoler. Les modèles ne passaient pas à côté des autres candidats parce qu’ils étaient incapables de les trouver. Tout était déjà devant eux.