Transparence stack de mesure

Modèles d'IA interrogés par AI COMMAND

Liste publique des LLM interrogés pour calculer le Score SOM des marques. Cette page reflète l'état exact de la stack de mesure et est mise à jour à chaque commit qui la modifie.

Dernière mise à jour : 19/07/2026Statuts fournisseurs vérifiés le : 16/08/20263 modèles interrogés, 2 replis déclarés, 3 prévus

Interrogés aujourd'hui

Ces modèles reçoivent réellement chaque requête d'audit. Le Score SOM est calculé sur eux, et sur eux seuls.

ModèleFournisseurVersion APIStatut chez nousStatut chez le fournisseurAjouté le
Gemini 2.5 FlashGooglegemini-2.5-flashInterrogéCourant26/04/2026
ChatGPT (GPT-4o)OpenAIgpt-4oInterrogéHérité26/04/2026
Claude Sonnet 4.6Anthropicclaude-sonnet-4-6InterrogéHérité26/04/2026
Gemini 1.5 FlashGooglegemini-1.5-flashFallbackAbsent du catalogue26/04/2026
Gemini 2.0 Flash LiteGooglegemini-2.0-flash-liteFallbackArrêté26/04/2026

Deux colonnes de statut, et elles ne disent pas la même chose. Statut chez nous indique ce que la plateforme appelle réellement. Statut chez le fournisseurreprend ce que l'éditeur déclare du modèle dans sa propre documentation, à la date de vérification indiquée en haut de page. Chaque pastille renvoie à la page officielle où le fait est vérifiable.

Anomalie ouverte, constatée le 16/08/2026

Deux des trois modèles de repli déclarés ne sont plus servis par leur fournisseur. La table officielle des dépréciations de Google donne une date d'arrêt au 1er juin 2026 pour gemini-2.0-flash-lite, et gemini-1.5-flashn'apparaît plus au catalogue officiel des modèles. La continuité annoncée par ces replis n'existe donc pas aujourd'hui. Le modèle principal du fournisseur reste stable et sans date d'arrêt annoncée, l'audit n'est donc pas interrompu, mais la chaîne de secours doit être révisée. Nous préférons publier l'anomalie plutôt que la corriger en silence après coup.

Intégrations prévues

Le code d'appel de ces moteurs existe dans la plateforme, mais leurs clés d'API ne sont pas configurées : ils ne sont pas interrogés aujourd'huiet n'entrent pas dans le calcul du Score SOM. Ils rejoindront la section précédente le jour où ils répondront réellement.

ModèleFournisseurVersion APIStatut chez nousStatut chez le fournisseurAjouté le
Perplexity Sonar ProPerplexitysonar-proPrévuNon documenté26/04/2026
Mistral LargeMistral AImistral-large-latestPrévuNon documenté26/04/2026
DeepSeek ChatDeepSeekdeepseek-chatPrévuNon documenté26/04/2026

Veille spécialisation verticale

LLM verticaux à surveiller

Modèles de langage spécialisés sur un secteur ou un domaine, suivis par AI COMMAND mais non encore intégrésau calcul du Score SOM. Cette liste sert une veille vérifiable : la spécialisation sectorielle des modèles est une hypothèse plausible, pas une bascule constatée, et aucune donnée publique d'usage ne permet aujourd'hui de la mesurer.

GPT-Rosalind

OpenAI · Sciences de la vie

Sous surveillance

Premier modèle vertical annoncé par un fournisseur majeur, orienté sciences de la vie. L'accès passe par un programme partenaires sur sélection, il n'est pas ouvert à tous. La liste nominative de partenaires qui figurait ici a été retirée le 16/08/2026 : nous n'avons pas pu la confronter à l'annonce officielle, dont la page bloque la consultation automatisée. Pertinent pour les marques santé et pharma, dont la visibilité pourrait un jour se jouer ailleurs que sur les modèles généralistes.

Annoncé le 16/04/2026Source officielle

Un modèle vertical passe de cette liste au registre actif uniquement quand il atteint un volume d'utilisateurs significatif et qu'une API stable est disponible. Voir la FAQ ci-dessous pour les critères d'intégration.

Sources institutionnelles et académiques

Ce que disent les rapports officiels

Les chiffres qui suivent proviennent de deux publications de référence, ouvertes à leur source primaire. Aucune donnée d'éditeur d'outil, d'agence ou de blog sectoriel n'entre dans cette section.

Stanford HAI, AI Index Report 2026

Un sommet dense, des évaluations qui s'épuisent

  • Six laboratoires occupent le premier rang du classement en mars 2026, dans un intervalle d'environ 80 points : Anthropic, xAI, Google, OpenAI, Alibaba et DeepSeek. Le premier modèle américain devance de 2,7 %, un écart resté à un chiffre sur l'année.
  • « Des évaluations conçues pour rester difficiles pendant des années sont saturées en quelques mois. » Les modèles de tête ont gagné 30 points de pourcentage en un an sur Humanity's Last Exam.
  • Une revue des jeux de tests relève des taux de questions invalides allant de 2 % sur MMLU Math à 42 % sur GSM8K.

Ce que cela n'établit pas : rien sur la visibilité d'une marque. Un classement de capacité ne dit pas quelle marque un modèle cite.

Chapitre Technical Performance, AI Index 2026

International AI Safety Report 2026

Des capacités en hausse, une fiabilité qui reste partielle

  • Rapport mandaté par les nations réunies au sommet de Bletchley, présidé par Yoshua Bengio. 29 nations, l'ONU, l'OCDE et l'Union européenne ont chacune nommé un représentant au panel consultatif. Plus de 100 experts ont contribué.
  • Les capacités progressent nettement en mathématiques, en code et en conduite autonome de tâches. Les modèles restent moins fiables lorsqu'un travail comporte de nombreuses étapes, et produisent toujours des énoncés faux.
  • Les agents, capables de planifier et d'utiliser des outils, sont identifiés comme un axe majeur de développement.

Ce que cela n'établit pas : aucune mesure de citation de marque, et aucune indication sur le comportement commercial d'un modèle donné.

International AI Safety Report 2026, arXiv:2602.21012

Pourquoi cela justifie de mesurer des sorties plutôt que de lire des classements

Un classement de capacité répond à la question « quel modèle raisonne le mieux ». Il ne répond pas à « quelle marque ce modèle nomme quand un acheteur l'interroge ». Le constat du rapport de Stanford sur la validité des jeux de tests, jusqu'à 42 % de questions invalides sur l'un d'eux, ajoute une raison de ne pas déduire un comportement commercial d'un score de benchmark. C'est pourquoi cette page documente les versions appelées et leur statut officiel, et rien de plus : le reste se constate sur les réponses obtenues.

Questions fréquentes

Quels modèles d'IA AI COMMAND interroge-t-il pour calculer le Score SOM ?

AI COMMAND interroge 3 modèles en production : Gemini 2.5 Flash, ChatGPT (GPT-4o), Claude Sonnet 4.6. 3 autres sont prévus et ne sont pas encore interrogés : Perplexity Sonar Pro, Mistral Large, DeepSeek Chat. La liste exacte avec versions est mise à jour publiquement à chaque évolution.

Pourquoi Perplexity, Mistral et DeepSeek apparaissent-ils comme prévus et non comme actifs ?

Le code d'appel de ces trois moteurs existe dans la plateforme, mais leurs clés d'API ne sont pas configurées : aucune requête ne leur est envoyée aujourd'hui. Les annoncer comme interrogés reviendrait à surestimer la couverture du Score SOM. Ils basculeront dans la section « Interrogés aujourd'hui » le jour où ils répondront réellement.

À quelle fréquence cette liste est-elle mise à jour ?

Deux dates distinctes figurent en haut de page, et elles ne disent pas la même chose. La première est celle du dernier changement de la stack de mesure, la seconde celle de la dernière vérification du statut de chaque modèle chez son fournisseur. Le rythme du secteur justifie ce contrôle séparé : l’AI Index Report 2026 de Stanford HAI relève que des évaluations conçues pour rester difficiles pendant des années sont saturées en quelques mois, et que six laboratoires occupent le premier rang de son classement en mars 2026, dans un intervalle d’environ 80 points. Une version d’API peut donc devenir héritée sans que rien ne casse.

Pourquoi rendre cette liste publique ?

Un Score SOM n'a de valeur que si l'on sait sur quels modèles il a été calculé. La transparence sur les versions interrogées est une condition d'auditabilité du score, et un point de parité minimum face aux concurrents API-first.

Que signifie le statut « fallback » ?

Un modèle « fallback » est utilisé uniquement si le modèle principal du même fournisseur est indisponible (quota dépassé, version dépréciée, timeout). Il garantit la continuité de l'audit sans biaiser le score, car il provient du même fournisseur.

Pourquoi mesurer un modèle de milieu de gamme et non le plus puissant du fournisseur ?

Par choix de protocole : le Score SOM vise le niveau de service courant, pas le palier premium réservé aux abonnements avancés ou à l’accès API direct. Ce choix a une limite que nous ne masquons pas : aucun fournisseur ne publié quel modèle sert exactement chaque utilisateur de son interface grand public à un instant donné. Nous ne pouvons donc pas prouver que la version appelée est celle que voit un utilisateur, seulement documenter précisément la version que nous appelons et son statut officiel. C’est ce que fait le tableau du cycle de vie ci-dessus.

Les versions interrogées sont-elles les plus récentes de chaque fournisseur ?

Non, et la page le dit plutôt que de le taire. Au 16 août 2026, la documentation d’Anthropic classe claude-sonnet-4-6 parmi les modèles hérités, le modèle courant de la gamme étant claude-sonnet-5, avec un retrait annoncé pas avant le 17 février 2027. Chez OpenAI, l’alias gpt-4o reste servi et ne figure pas parmi les modèles dépréciés, mais la famille de tête au catalogue est GPT-5.6. Chez Google, gemini-2.5-flash reste un modèle stable sans date d’arrêt annoncée. Changer une version de mesure n’est pas neutre : cela rompt la comparabilité des scores dans le temps. La mise à jour est donc un arbitrage, pas un réflexe.

Les modèles de repli sont-ils tous opérationnels ?

Non, et c’est une anomalie identifiée le 16 août 2026. La table officielle des dépréciations de Google donne une date d’arrêt au 1er juin 2026 pour gemini-2.0-flash-lite, et gemini-1.5-flash n’apparaît plus au catalogue officiel des modèles. Ces deux replis ne peuvent donc plus jouer leur rôle. Le modèle principal du fournisseur, lui, reste stable et sans date d’arrêt annoncée. La chaîne de repli doit être révisée, et cette page ne prétendra pas qu’elle fonctionne tant que ce ne sera pas fait.

Comment AI COMMAND décide-t-il d'ajouter ou de retirer un modèle ?

Trois critères : (1) le modèle est servi à un volume significatif d'utilisateurs finaux dans son produit grand public, (2) une API stable est disponible avec un coût compatible avec le pricing d'AI COMMAND, (3) son ajout n'introduit pas de discontinuité dans la comparabilité historique des scores. Une nouvelle version d'un modèle existant est intégrée si elle remplace effectivement la précédente côté grand public.

Pourquoi AI COMMAND surveille-t-il les LLM verticaux ?

Parce qu’un modèle spécialisé sur un secteur pourrait, à terme, décider de la visibilité des marques de ce secteur. GPT-Rosalind, annoncé par OpenAI le 16 avril 2026 et orienté sciences de la vie, est le premier cas d’un fournisseur majeur. Ce qui suit relève de l’hypothèse et non du constat : nous ne disposons d’aucune donnée publique sur l’usage réel de ces modèles, et une vague de spécialisation est plausible sans être établie. Cette page les liste pour rendre la veille vérifiable, pas pour annoncer une bascule.

Quand un LLM vertical sera-t-il intégré dans le calcul du Score SOM ?

Un modèle vertical passe de la liste de surveillance au registre actif quand il remplit les trois mêmes critères que les modèles généralistes : (1) volume d'utilisateurs réel dans son produit, (2) API stable et coût compatible, (3) absence de discontinuité dans la comparabilité des scores. Pour un secteur donné, un modèle vertical adopté à grande échelle sera ajouté aux modèles interrogés sur ce secteur uniquement, sans impacter les autres verticaux du Score SOM.

Mesurez votre Score SOM sur les modèles interrogés

Lancez un audit et obtenez votre score de visibilité IA, décomposé modèle par modèle, sur les seules versions listées comme interrogées ci-dessus.