Protocole exécuté, Score SOM v6.0

Ce que le moteur fait réellement

Cette page décrit la méthode telle qu'elle est exécutée par le code de production, pas telle qu'elle est envisagée. Chaque chiffre est lu depuis la configuration du moteur. Les limites sont publiées au même titre que la formule.

Un protocole antérieur a été archivé

Le document publié en mai 2026 décrivait plusieurs éléments qui relevaient d'une méthode projetée et non de l'implémentation de production, notamment le nombre de moteurs, le nombre de passes par requête et l'usage d'une recherche web. Il est conservé à des fins de traçabilité et clairement marqué comme archive. Consulter l'archive.

Le protocole, paramètre par paramètre

Moteurs interrogés3 moteurs : Gemini, ChatGPT et Claude
Modèles exactsgemini-2.5-flash, gpt-4o, claude-sonnet-4-6
Paramètres d'appelGemini : température 0.3, 2048 tokens · ChatGPT : température 0.5, 1800 tokens · Claude : température par défaut du fournisseur, 1800 tokens
Mode de mesureMémoire des modèles, sans accès à une recherche en ligne
Portefeuille de requêtes12 à 16 requêtes : 10 sectorielles, jusqu'à 2 comparaisons directes, 2 de réputation à poids nul, jusqu'à 2 locales si une localisation est saisie
Secteurs couverts13 taxonomies sectorielles françaises
Passes par requête et par moteur1. La variance de la mesure n'est donc pas connue.
Version de la formule5.1

Score SOM v6.0

Les 10facteurs, et ce qu'ils valent

Sur ces 10 facteurs, 2 sont calculés à partir de ce que nous observons. Les 7 autres sont déclarés par le modèle mesuré, sur sa propre réponse, et ne sont pas recalculés à partir du texte. Nous le signalons dans le tableau plutôt que de le laisser deviner.

#FacteurPlageNaturePrécision
1Position1 / ln(pos + e)Déclaré par le modèlePosition déclarée par le modèle, jamais extraite du texte
2Sentiment0,15 à 1,30Déclaré par le modèleTonalité déclarée par le modèle sur sa propre réponse
3Hallucination0,70 ou 1,00Déclaré par le modèleFacteur documenté mais sans effet sur le score livré, voir les limites
4Consensus inter-modèles0,40 + 0,60 × ratioObservéDénominateur = moteurs ayant répondu, voir les limites
5Rôle narratif0,10 à 1,00Déclaré par le modèleCentralité déclarée par le modèle
6Force de recommandation0,00 à 1,00Déclaré par le modèleConviction déclarée par le modèle
7Type de preuve0,60 à 1,15Déclaré par le modèleNature de sa propre croyance, déclarée par le modèle
8Fraîcheur de connaissance0,50 à 1,00Déclaré par le modèleDatation par le modèle de sa propre mémoire
9Palier d'autorité0,75 à 1,20Déclaré par le modèleQualité de sources déclarée sans accès web
10Diversité des sources+0 % à +12 %ObservéNombre de types de sources distincts déclarés

La formule, intégralement

# Score par requête citee
qualityMean   = moyenne(narratif, force_reco, preuve, fraicheur, autorite)
queryScore    = positionDecay(pos) x sentiment x hallucination x consensus x qualityMean

# Agregation ponderee par intention d achat
numerateur   = SOMME sur les requêtes citées de ( poids x queryScore )
denominateur = SOMME sur TOUTES les requêtes de poids

# Normalisation par le maximum theorique par requête
MAX_PER_QUERY     = positionDecay(1) x 1,30 x 1,07 = 1,0592
normalizedQuality = numerateur / ( denominateur x MAX_PER_QUERY )

# Score final
coverageFactor = racine( poids_cites / denominateur )
diversityBonus = min(1,12 ; 1 + 0,025 x min(nb_types_sources ; 5))
score          = arrondi( min(100 ; normalizedQuality x coverageFactor x diversityBonus x 100) , 1 decimale )

La couverture intervient deux fois : une première par le rapport entre numérateur et dénominateur, une seconde par le facteur de couverture. Le dénominateur effectif est donc élevé à la puissance 1,5. Ce n'est pas nécessairement une erreur, mais ce n'était pas signalé jusqu'ici.

Limites assumées

Ce que cette mesure ne dit pas

Une limite publiée ne peut pas être révélée par un tiers. Celles-ci sont issues d'un audit du code conduit en août 2026. Plusieurs sont des défauts que nous corrigeons, pas des choix que nous défendons.

  1. 01La mesure porte sur la memoire des modeles, sans recherche web. Elle ne reproduit pas ce que voit un utilisateur dont l assistant declenche une recherche.
  2. 02Sept des dix facteurs du score sont declares par le modele mesure sur sa propre reponse. Ils ne sont pas recalcules a partir du texte.
  3. 03Une seule execution par prompt et par moteur. La variance de la mesure n est donc pas connue, et aucun intervalle de confiance ne porte sur le score lui-meme.
  4. 04Le prompt communique au modele le nom de la marque, ses concurrents et une fiche de faits avant de poser la question. La mesure porte donc sur une emergence assistee, pas spontanee.
  5. 05Le facteur hallucination est documente mais sans effet sur le score livre. Correction prevue en 6.3.
  6. 06Le denominateur du facteur de consensus compte les moteurs ayant repondu, pas les moteurs interroges. Une panne d API deplace donc le score.
  7. 07Les sources sont declarees par le modele, pas collectees ni verifiees.
  8. 08Aucune distribution sectorielle n a ete etablie. Les seuils de grade et de positionnement sont conventionnels.
  9. 09Les appels sont emis depuis us-central1 pour mesurer un marche francais. L effet de la localisation n a pas ete mesure.
  10. 10Aucune validation externe ne demontre a ce jour que le score predit une grandeur d affaires observable.

Reproductibilité

Ce qui est reproductible, et ce qui ne l'est pas

Reproductible

  • Le portefeuille de requêtes, strictement identique pour des entrées identiques.
  • La formule, recalculable à la main à partir des valeurs publiées ci-dessus.
  • Le moteur de calcul, rejouable hors ligne à partir d'un enregistrement complet de la mesure.

Non reproductible

  • Les réponses des modèles, qui sont stochastiques et dérivent dans le temps.
  • L'écart entre deux exécutions, faute d'une mesure de la variance. Nous ne publions donc aucune tolérance chiffrée.

Où nous en sommes exactement

Le moteur de calcul est désormais reproductible hors ligne à partir d'un enregistrement complet de la mesure. La validation de la chaîne de production complète est en cours : elle exige un audit réel exécuté après déploiement, dont l'enregistrement soit rejoué sans aucun accès réseau et redonne exactement le score livré.

Tant que cette validation n'est pas faite, nous n'écrivons pas qu'AI COMMAND est reproductible. Nous avons retiré pour la même raison la promesse de reproductibilité chiffrée qui figurait ici : elle n'est pas tenable tant que la variance de la mesure n'a pas été mesurée, et une promesse invérifiable vaut moins qu'une limite assumée.

Méthode et limites

Moteurs observés
3 moteurs interrogés par API : Gemini, ChatGPT et Claude. Les moteurs dont le connecteur existe mais dont la clé n'est pas montée ne sont jamais interrogés et ne comptent dans aucun total publié.
Nature des réponses
Les réponses des modèles sont stochastiques. Deux exécutions identiques peuvent différer, et la mesure porte sur la mémoire d'entraînement des modèles, sans recherche web. Elle ne reproduit pas ce que voit un utilisateur dont l'assistant déclenche une recherche.
Date de mesure
Un score est daté. Il décrit l'état des modèles au moment de la mesure, pas un état courant. Toute comparaison suppose que les deux mesures sont lues avec leur date.
Absence de garantie de permanence
Un résultat observé ne se reconduit pas. Les modèles sont réentraînés et reconfigurés par leurs fournisseurs, sans préavis ni journal public. AI COMMAND mesure et documente, et ne garantit ni le maintien d'une position, ni l'obtention d'une citation.
Déclaration d'intérêts
AI COMMAND est édité par ELMARQ, qui vend par ailleurs des prestations liées à la visibilité algorithmique. L'éditeur de la mesure a donc un intérêt commercial aux constats qu'elle produit. C'est la raison pour laquelle la formule, les moteurs et les limites sont publiés : ils doivent pouvoir être contestés sans passer par nous.

Documents

Archive

SOM Scorecard Protocol v2.0

Publié en mai 2026. Décrit en partie une méthode projetée. Conservé pour la traçabilité, à ne pas utiliser comme référence de la méthode courante.

En vigueur

Protocole exécuté v6.0

La présente page. Chaque valeur y est lue depuis la configuration du moteur, et une garde de build empêche toute divergence entre ce qui est affiché et ce qui est exécuté.