Quels modèles d'IA AI COMMAND interroge-t-il pour calculer le Score SOM ?
AI COMMAND interroge 3 modèles en production : Gemini 2.5 Flash, ChatGPT (GPT-4o), Claude Sonnet 4.6. 3 autres sont prévus et ne sont pas encore interrogés : Perplexity Sonar Pro, Mistral Large, DeepSeek Chat. La liste exacte avec versions est mise à jour publiquement à chaque évolution.
Pourquoi Perplexity, Mistral et DeepSeek apparaissent-ils comme prévus et non comme actifs ?
Le code d'appel de ces trois moteurs existe dans la plateforme, mais leurs clés d'API ne sont pas configurées : aucune requête ne leur est envoyée aujourd'hui. Les annoncer comme interrogés reviendrait à surestimer la couverture du Score SOM. Ils basculeront dans la section « Interrogés aujourd'hui » le jour où ils répondront réellement.
À quelle fréquence cette liste est-elle mise à jour ?
Deux dates distinctes figurent en haut de page, et elles ne disent pas la même chose. La première est celle du dernier changement de la stack de mesure, la seconde celle de la dernière vérification du statut de chaque modèle chez son fournisseur. Le rythme du secteur justifie ce contrôle séparé : l’AI Index Report 2026 de Stanford HAI relève que des évaluations conçues pour rester difficiles pendant des années sont saturées en quelques mois, et que six laboratoires occupent le premier rang de son classement en mars 2026, dans un intervalle d’environ 80 points. Une version d’API peut donc devenir héritée sans que rien ne casse.
Pourquoi rendre cette liste publique ?
Un Score SOM n'a de valeur que si l'on sait sur quels modèles il a été calculé. La transparence sur les versions interrogées est une condition d'auditabilité du score, et un point de parité minimum face aux concurrents API-first.
Que signifie le statut « fallback » ?
Un modèle « fallback » est utilisé uniquement si le modèle principal du même fournisseur est indisponible (quota dépassé, version dépréciée, timeout). Il garantit la continuité de l'audit sans biaiser le score, car il provient du même fournisseur.
Pourquoi mesurer un modèle de milieu de gamme et non le plus puissant du fournisseur ?
Par choix de protocole : le Score SOM vise le niveau de service courant, pas le palier premium réservé aux abonnements avancés ou à l’accès API direct. Ce choix a une limite que nous ne masquons pas : aucun fournisseur ne publié quel modèle sert exactement chaque utilisateur de son interface grand public à un instant donné. Nous ne pouvons donc pas prouver que la version appelée est celle que voit un utilisateur, seulement documenter précisément la version que nous appelons et son statut officiel. C’est ce que fait le tableau du cycle de vie ci-dessus.
Les versions interrogées sont-elles les plus récentes de chaque fournisseur ?
Non, et la page le dit plutôt que de le taire. Au 16 août 2026, la documentation d’Anthropic classe claude-sonnet-4-6 parmi les modèles hérités, le modèle courant de la gamme étant claude-sonnet-5, avec un retrait annoncé pas avant le 17 février 2027. Chez OpenAI, l’alias gpt-4o reste servi et ne figure pas parmi les modèles dépréciés, mais la famille de tête au catalogue est GPT-5.6. Chez Google, gemini-2.5-flash reste un modèle stable sans date d’arrêt annoncée. Changer une version de mesure n’est pas neutre : cela rompt la comparabilité des scores dans le temps. La mise à jour est donc un arbitrage, pas un réflexe.
Les modèles de repli sont-ils tous opérationnels ?
Non, et c’est une anomalie identifiée le 16 août 2026. La table officielle des dépréciations de Google donne une date d’arrêt au 1er juin 2026 pour gemini-2.0-flash-lite, et gemini-1.5-flash n’apparaît plus au catalogue officiel des modèles. Ces deux replis ne peuvent donc plus jouer leur rôle. Le modèle principal du fournisseur, lui, reste stable et sans date d’arrêt annoncée. La chaîne de repli doit être révisée, et cette page ne prétendra pas qu’elle fonctionne tant que ce ne sera pas fait.
Comment AI COMMAND décide-t-il d'ajouter ou de retirer un modèle ?
Trois critères : (1) le modèle est servi à un volume significatif d'utilisateurs finaux dans son produit grand public, (2) une API stable est disponible avec un coût compatible avec le pricing d'AI COMMAND, (3) son ajout n'introduit pas de discontinuité dans la comparabilité historique des scores. Une nouvelle version d'un modèle existant est intégrée si elle remplace effectivement la précédente côté grand public.
Pourquoi AI COMMAND surveille-t-il les LLM verticaux ?
Parce qu’un modèle spécialisé sur un secteur pourrait, à terme, décider de la visibilité des marques de ce secteur. GPT-Rosalind, annoncé par OpenAI le 16 avril 2026 et orienté sciences de la vie, est le premier cas d’un fournisseur majeur. Ce qui suit relève de l’hypothèse et non du constat : nous ne disposons d’aucune donnée publique sur l’usage réel de ces modèles, et une vague de spécialisation est plausible sans être établie. Cette page les liste pour rendre la veille vérifiable, pas pour annoncer une bascule.
Quand un LLM vertical sera-t-il intégré dans le calcul du Score SOM ?
Un modèle vertical passe de la liste de surveillance au registre actif quand il remplit les trois mêmes critères que les modèles généralistes : (1) volume d'utilisateurs réel dans son produit, (2) API stable et coût compatible, (3) absence de discontinuité dans la comparabilité des scores. Pour un secteur donné, un modèle vertical adopté à grande échelle sera ajouté aux modèles interrogés sur ce secteur uniquement, sans impacter les autres verticaux du Score SOM.