Verdict factuel : le problème n’est plus seulement de savoir quel modèle arrive premier. Dans son AI Index 2026, Stanford HAI rapporte un gain de 30 points de pourcentage en un an des modèles de pointe sur Humanity’s Last Exam. Sur OSWorld, un test de tâches sur ordinateur, la précision est passée d’environ 12 % à 66,3 %. Ces progrès rendent les classements utiles, mais moins durables pour acheter ou déployer un outil.
Le chiffre important n’est donc pas le nom d’un vainqueur : c’est la vitesse à laquelle une épreuve difficile cesse de départager les offres. Pour une équipe française, la conséquence est simple : présélectionner avec les résultats publics, puis départager avec ses propres tâches, ses données autorisées et son coût réel.
À retenir
- Les modèles de frontière ont gagné 30 points en un an sur Humanity’s Last Exam, selon Stanford HAI.
- Sur OSWorld, le score est passé d’environ 12 % à 66,3 %, à moins de six points de la performance humaine dans ce protocole.
- Stanford indique aussi que les modèles échouent encore environ une fois sur trois sur des benchmarks structurés de tâches agentiques.
Les chiffres, leur périmètre et leurs limites
| Mesure | Résultat publié | Ce qu’elle mesure | Ce qu’elle ne mesure pas |
|---|---|---|---|
| Humanity’s Last Exam | +30 points en un an | Questions expertes conçues pour rester difficiles | La fiabilité dans vos documents internes |
| OSWorld | ~12 % → 66,3 % | Tâches sur ordinateur et OS | Un poste de travail sans supervision |
| OSWorld / humain | moins de 6 points | Écart sur ce protocole précis | La qualité métier, le coût ou la sécurité |
| Tâches agentiques | ~1 échec sur 3 | Robustesse dans les tests suivis | Un taux universel d’erreur |
Pourquoi un benchmark qui progresse vite devient moins décisif
Un benchmark est une épreuve standardisée : jeu de questions, règle de correction et conditions annoncées. Il sert à suivre une tendance ; il ne suffit pas à signer un bon de commande. Quand les scores de tête progressent de 30 points sur douze mois, l’épreuve reste informative techniquement, mais elle différencie moins longtemps les outils disponibles au moment où une DSI les compare.
Humanity’s Last Exam est présenté par ses auteurs comme un benchmark multidisciplinaire difficile. Un bon résultat signale une capacité à répondre à ce corpus. Il ne démontre ni le respect de vos habilitations, ni la bonne citation d’une procédure interne, ni le coût par dossier. C’est la différence entre une mesure de capacité et une preuve d’exploitation.
OSWorld : un saut réel, mais un environnement contrôlé
OSWorld évalue des agents qui manipulent des environnements informatiques pour réaliser des tâches. Stanford HAI situe la progression d’environ 12 % à 66,3 % et l’écart à moins de six points de la performance humaine. Le site officiel d’OSWorld décrit les environnements et le mode d’évaluation : cette documentation est indispensable avant de comparer un score à un autre.
« Proche de l’humain » ne veut pas dire « autonome au bureau ». Une tâche de benchmark a une fin définie et un environnement préparé. En production, des onglets imprévus, des données personnelles, une interface modifiée, une validation ou un paiement changent le risque. Le constat de Stanford — environ un échec sur trois dans des évaluations structurées — justifie une reprise humaine, surtout lorsqu’une action est irréversible.
Comparer Claude, GPT, Gemini ou un modèle ouvert : la bonne méthode
Les scores publics forment une première passe, jamais un vainqueur universel. Claude, GPT, Gemini et les modèles ouverts se distinguent aussi par le code, le multimodal, les modalités API, la vitesse, le français, la confidentialité et le prix. Pour le code, utilisez le même ticket et la même suite de tests. Pour le multimodal, testez les mêmes PDF ou tableaux autorisés. Pour le français, préparez des requêtes métier, des abréviations et des formulations ambiguës.
| Critère | Essai court | Indicateur conservé |
|---|---|---|
| Raisonnement | 20 cas anonymisés avec réponse attendue | Réponse juste et vérifiable |
| Code | Mêmes tickets et tests unitaires | Tests passés, régressions, revue |
| Multimodal | Même PDF ou capture autorisée | Extraction et citations correctes |
| API, coût, vitesse | 100 requêtes représentatives | Jetons, latence p95, reprises |
| Confidentialité | Lecture des réglages et contrats | Conservation, entraînement, région |
Ce que les données prouvent — et ce qu’elles ne prouvent pas
Elles établissent que les performances mesurées sur certaines épreuves accélèrent rapidement. Elles ne prouvent pas qu’un modèle donné sera le meilleur pour toutes les langues, APIs ou tâches. Elles ne permettent pas non plus d’inférer un gain de productivité : celui-ci dépend du temps de contrôle, de l’intégration, de la qualité des données et des erreurs évitées ou introduites.
Pour un achat, une hausse de score est un signal de présélection, pas un SLA. Les fiches de modèle et la documentation API restent nécessaires pour vérifier contexte, prix, limitations et traitement des données. Le AI Risk Management Framework du NIST aide à relier mesure, risque et gouvernance : décrire le cas d’usage, mesurer l’erreur, prévoir un recours et tracer les changements de version.
Une conséquence opérationnelle : tester plus souvent, mais plus petit
Un comparatif annuel devient vite obsolète quand les benchmarks saturent en quelques mois. Rejouez plutôt un protocole léger à chaque changement majeur : mêmes cas, même prompt versionné, mêmes droits, mêmes métriques. Conservez sorties, coûts et erreurs. Commencez par une tâche réversible — classification, résumé sourcé ou brouillon de code testé — puis élargissez seulement si le temps de correction baisse réellement.
Questions fréquentes
Un benchmark élevé garantit-il un bon agent IA ?
Non. Il décrit un protocole donné. Il faut aussi tester permissions, données, erreurs, latence et reprise humaine.
Pourquoi ne pas choisir le modèle le mieux classé ?
Le classement peut mesurer une compétence différente de votre tâche. Prix API, vitesse, français, code, multimodal et confidentialité modifient le choix.
Les chiffres Stanford sont-ils des résultats en entreprise ?
Non. Ils décrivent des performances sur benchmarks, pas une productivité garantie en entreprise.
Sources utiles
- Stanford HAI — AI Index 2026, Technical Performance (consulté le 23 septembre 2026)
- Humanity’s Last Exam — documentation du benchmark (consulté le 23 septembre 2026)
- OSWorld — benchmark et environnements (consulté le 23 septembre 2026)
- NIST — AI Risk Management Framework (consulté le 23 septembre 2026)
Par Vincent Vandegans — Minderlist. Vincent analyse les outils, modèles et usages concrets de l’intelligence artificielle.
