Clavier d’ordinateur et benchmarks de modèles IA

Verdict factuel : un score remarquable ne suffit pas à choisir un modèle pour une équipe. L’AI Index 2026 de Stanford résume un contraste utile : Gemini Deep Think a atteint le niveau médaille d’or à l’Olympiade internationale de mathématiques, mais le meilleur modèle de son panel ne lit correctement une horloge analogique que dans 50,1 % des cas. Sur OSWorld, les agents sont passés d’environ 12 % à 66 % de réussite : progrès massif, mais environ une tâche sur trois échoue encore.

Pour un responsable produit, ce chiffre change la bonne question. Il ne s’agit pas de demander « quel modèle est premier ? », mais « quelle erreur peut-il commettre sur notre tâche, avec nos données et nos droits d’accès ? ».

Trois points à retenir

  • Une performance de concours n’est pas une moyenne d’usage. Les mathématiques, la vision et l’action dans une interface ne testent pas la même chose.
  • Le progrès d’agent est réel, mais incomplet. Un taux proche de 66 % n’autorise pas une automatisation sans contrôle sur une opération sensible.
  • Gemini, Claude et GPT doivent être testés sur le travail réel. Code, français, fichiers, latence, coût API et confidentialité sont des axes séparés.

Le chiffre qui oblige à regarder au-delà des démos

Stanford qualifie ce phénomène de « frontière dentelée » : les capacités ne progressent pas à la même vitesse. Le rapport 2026 associe trois résultats : la médaille d’or de Gemini Deep Think à l’IMO, 50,1 % de réponses correctes pour la lecture d’horloges analogiques par le meilleur modèle du panel, et environ 66 % de réussite sur OSWorld contre environ 12 % auparavant. Les chiffres sont datés de l’édition 2026 et portent sur des protocoles distincts.

Mesure Chiffre rapporté Ce qu’elle teste Ce qu’elle ne prouve pas
Lecture d’horloge 50,1 % Vision et raisonnement spatial sur une image La compréhension de tous les documents métier
OSWorld ≈ 66 % ; ≈ 12 % auparavant Des tâches sur ordinateur et interfaces L’autonomie sûre dans un compte de production
IMO Niveau médaille d’or Problèmes mathématiques de compétition La qualité d’un agent CRM, support ou comptable

Tableau original Minderlist, à partir de Stanford HAI 2026. Les protocoles, versions et modèles ne sont pas interchangeables.

Pourquoi ces résultats ne se contredisent pas

Une épreuve de mathématiques propose des règles explicites et une vérification structurée. OSWorld est plus proche d’une séquence opérationnelle : trouver une information, naviguer dans une application, modifier une interface. La lecture d’une horloge isole une difficulté de perception. Un même système peut être excellent sur l’une de ces tâches et fragile sur une autre.

La conséquence est concrète : un agent qui change un statut CRM ou déclenche un e-mail ne doit pas être évalué avec un benchmark de maths. Il faut mesurer son taux de réussite sur les cas attendus, puis examiner chaque échec. Une erreur de reformulation est récupérable ; une erreur de paiement ou de suppression ne l’est pas. Droits minimaux, journalisation, prévisualisation et validation humaine restent nécessaires.

Gemini, Claude ou GPT : une comparaison utile

La médaille IMO est documentée par Google DeepMind. C’est un signal solide pour le raisonnement mathématique de ce système précis, pas une victoire générale pour chaque offre Gemini. Claude et GPT sont des alternatives pertinentes dès que le besoin bascule vers le code, les documents, les outils ou des consignes françaises. Aucun des chiffres ci-dessus ne permet de les classer universellement.

Critère Comment départager les trois familles
Raisonnement Donner les mêmes problèmes métier, demander les étapes vérifiables et noter les erreurs factuelles.
Code Exécuter les tests de votre dépôt ; mesurer la correction, les régressions et la lisibilité du diff.
Multimodal Tester les mêmes PDF, tableaux, images et captures, avec une réponse attendue connue.
Français Inclure abréviations, vocabulaire métier, ambiguïtés et demandes mal formulées.
Vitesse et API Mesurer la latence et le coût sur le même volume. Les tarifs changent : consulter les pages officielles de Claude et d’OpenAI avant un calcul.
Confidentialité Vérifier l’offre et le contrat : les règles API, Team et Enterprise diffèrent. Voir notamment les engagements Enterprise d’OpenAI et la documentation Anthropic.

Un protocole de test en français, en cinq étapes

  1. Préparez 20 à 50 cas anonymisés : e-mails, tickets, extraits de code, tableaux, PDF et captures réellement représentatifs.
  2. Écrivez la condition de réussite avant le test : réponse exacte, source, fichier valide, délai maximal, budget maximal et règle d’escalade.
  3. Utilisez le même prompt et les mêmes fichiers pour Gemini, Claude et GPT. Conservez les sorties ratées, pas seulement les démonstrations.
  4. Classez les erreurs par gravité : style, information erronée, action non demandée, fuite de donnée, action irréversible.
  5. Décidez tâche par tâche. Un modèle peut aider au brouillon mais ne pas recevoir le droit de publier ou modifier une donnée.

Ce que la hausse d’OSWorld prouve — et ne prouve pas

Le passage d’environ 12 % à environ 66 % constitue un changement important dans le benchmark. Il indique que les agents réussissent davantage de séquences sur ordinateur qu’auparavant. Il ne constitue pas un SLA : votre environnement inclut SSO, droits, pop-ups, données incomplètes et exceptions métier. Les nombres de Stanford sont des ordres de grandeur de benchmark ; ne les convertissez pas en promesse contractuelle.

Le site du benchmark OSWorld détaille son objectif : évaluer des agents dans des environnements informatiques. C’est une source méthodologique indispensable pour interpréter le score. Entre deux versions de modèle, les outils autorisés et les réglages peuvent aussi varier.

Pour qui cet écart est important

Achats et DSI : demandez un pilote sur vos flux, pas une capture de classement. Développeurs : gardez CI, revue humaine et scan de dépendances. Équipes SEO, support et opérations : commencez par les actions réversibles ; faites approuver publication, envoi et modification de données. Un modèle qui réussit une grande part de tâches sans gravité peut être utile ; le même taux est insuffisant si l’échec crée un dommage élevé.

Questions fréquentes

Un modèle médaillé à l’IMO est-il le meilleur pour mon entreprise ?

Non. Le résultat porte sur une épreuve donnée. Testez aussi vos documents, votre code, les actions d’interface, le prix et les règles de données.

66 % de réussite sur OSWorld suffit-il pour automatiser ?

Pas sans garde-fous. Le taux moyen ne donne pas le coût de chaque erreur ; les opérations sensibles doivent conserver une validation.

Quel modèle est le meilleur en français ?

Ces statistiques ne désignent pas un vainqueur universel. Comparez les mêmes cas français dans votre contexte et avec l’offre réellement contractée.

Où vérifier les prix API ?

Sur les grilles officielles, car les modèles, caches et fonctionnalités changent les prix.

Sources utiles

Vincent Vandegans écrit sur les outils, modèles et usages concrets de l’intelligence artificielle pour Minderlist.

Rédigé par

vincent vandegans

Vincent est ingénieur , spécialisé en IA, il conseille les entreprises sur leur stratégie IA tant d'un côté technique qu'humain.