Protocole exécuté, Score SOM v6.0
Cette page décrit la méthode telle qu'elle est exécutée par le code de production, pas telle qu'elle est envisagée. Chaque chiffre est lu depuis la configuration du moteur. Les limites sont publiées au même titre que la formule.
Un protocole antérieur a été archivé
Le document publié en mai 2026 décrivait plusieurs éléments qui relevaient d'une méthode projetée et non de l'implémentation de production, notamment le nombre de moteurs, le nombre de passes par requête et l'usage d'une recherche web. Il est conservé à des fins de traçabilité et clairement marqué comme archive. Consulter l'archive.
| Moteurs interrogés | 3 moteurs : Gemini, ChatGPT et Claude |
|---|---|
| Modèles exacts | gemini-2.5-flash, gpt-4o, claude-sonnet-4-6 |
| Paramètres d'appel | Gemini : température 0.3, 2048 tokens · ChatGPT : température 0.5, 1800 tokens · Claude : température par défaut du fournisseur, 1800 tokens |
| Mode de mesure | Mémoire des modèles, sans accès à une recherche en ligne |
| Portefeuille de requêtes | 12 à 16 requêtes : 10 sectorielles, jusqu'à 2 comparaisons directes, 2 de réputation à poids nul, jusqu'à 2 locales si une localisation est saisie |
| Secteurs couverts | 13 taxonomies sectorielles françaises |
| Passes par requête et par moteur | 1. La variance de la mesure n'est donc pas connue. |
| Version de la formule | 5.1 |
Score SOM v6.0
Sur ces 10 facteurs, 2 sont calculés à partir de ce que nous observons. Les 7 autres sont déclarés par le modèle mesuré, sur sa propre réponse, et ne sont pas recalculés à partir du texte. Nous le signalons dans le tableau plutôt que de le laisser deviner.
| # | Facteur | Plage | Nature | Précision |
|---|---|---|---|---|
| 1 | Position | 1 / ln(pos + e) | Déclaré par le modèle | Position déclarée par le modèle, jamais extraite du texte |
| 2 | Sentiment | 0,15 à 1,30 | Déclaré par le modèle | Tonalité déclarée par le modèle sur sa propre réponse |
| 3 | Hallucination | 0,70 ou 1,00 | Déclaré par le modèle | Facteur documenté mais sans effet sur le score livré, voir les limites |
| 4 | Consensus inter-modèles | 0,40 + 0,60 × ratio | Observé | Dénominateur = moteurs ayant répondu, voir les limites |
| 5 | Rôle narratif | 0,10 à 1,00 | Déclaré par le modèle | Centralité déclarée par le modèle |
| 6 | Force de recommandation | 0,00 à 1,00 | Déclaré par le modèle | Conviction déclarée par le modèle |
| 7 | Type de preuve | 0,60 à 1,15 | Déclaré par le modèle | Nature de sa propre croyance, déclarée par le modèle |
| 8 | Fraîcheur de connaissance | 0,50 à 1,00 | Déclaré par le modèle | Datation par le modèle de sa propre mémoire |
| 9 | Palier d'autorité | 0,75 à 1,20 | Déclaré par le modèle | Qualité de sources déclarée sans accès web |
| 10 | Diversité des sources | +0 % à +12 % | Observé | Nombre de types de sources distincts déclarés |
# Score par requête citee qualityMean = moyenne(narratif, force_reco, preuve, fraicheur, autorite) queryScore = positionDecay(pos) x sentiment x hallucination x consensus x qualityMean # Agregation ponderee par intention d achat numerateur = SOMME sur les requêtes citées de ( poids x queryScore ) denominateur = SOMME sur TOUTES les requêtes de poids # Normalisation par le maximum theorique par requête MAX_PER_QUERY = positionDecay(1) x 1,30 x 1,07 = 1,0592 normalizedQuality = numerateur / ( denominateur x MAX_PER_QUERY ) # Score final coverageFactor = racine( poids_cites / denominateur ) diversityBonus = min(1,12 ; 1 + 0,025 x min(nb_types_sources ; 5)) score = arrondi( min(100 ; normalizedQuality x coverageFactor x diversityBonus x 100) , 1 decimale )
La couverture intervient deux fois : une première par le rapport entre numérateur et dénominateur, une seconde par le facteur de couverture. Le dénominateur effectif est donc élevé à la puissance 1,5. Ce n'est pas nécessairement une erreur, mais ce n'était pas signalé jusqu'ici.
Limites assumées
Une limite publiée ne peut pas être révélée par un tiers. Celles-ci sont issues d'un audit du code conduit en août 2026. Plusieurs sont des défauts que nous corrigeons, pas des choix que nous défendons.
Reproductibilité
Où nous en sommes exactement
Le moteur de calcul est désormais reproductible hors ligne à partir d'un enregistrement complet de la mesure. La validation de la chaîne de production complète est en cours : elle exige un audit réel exécuté après déploiement, dont l'enregistrement soit rejoué sans aucun accès réseau et redonne exactement le score livré.
Tant que cette validation n'est pas faite, nous n'écrivons pas qu'AI COMMAND est reproductible. Nous avons retiré pour la même raison la promesse de reproductibilité chiffrée qui figurait ici : elle n'est pas tenable tant que la variance de la mesure n'a pas été mesurée, et une promesse invérifiable vaut moins qu'une limite assumée.
Publié en mai 2026. Décrit en partie une méthode projetée. Conservé pour la traçabilité, à ne pas utiliser comme référence de la méthode courante.
La présente page. Chaque valeur y est lue depuis la configuration du moteur, et une garde de build empêche toute divergence entre ce qui est affiché et ce qui est exécuté.