
Verdict factuel : un score remarquable ne suffit pas à choisir un modèle pour une équipe. L’AI Index 2026 de Stanford résume un contraste utile : Gemini Deep Think a atteint le niveau médaille d’or à l’Olympiade internationale de mathématiques, mais le meilleur modèle de son panel ne lit correctement une horloge analogique que dans 50,1 % des cas. Sur OSWorld, les agents sont passés d’environ 12 % à 66 % de réussite : progrès massif, mais environ une tâche sur trois échoue encore.
Pour un responsable produit, ce chiffre change la bonne question. Il ne s’agit pas de demander « quel modèle est premier ? », mais « quelle erreur peut-il commettre sur notre tâche, avec nos données et nos droits d’accès ? ».
Trois points à retenir
- Une performance de concours n’est pas une moyenne d’usage. Les mathématiques, la vision et l’action dans une interface ne testent pas la même chose.
- Le progrès d’agent est réel, mais incomplet. Un taux proche de 66 % n’autorise pas une automatisation sans contrôle sur une opération sensible.
- Gemini, Claude et GPT doivent être testés sur le travail réel. Code, français, fichiers, latence, coût API et confidentialité sont des axes séparés.
Le chiffre qui oblige à regarder au-delà des démos
Stanford qualifie ce phénomène de « frontière dentelée » : les capacités ne progressent pas à la même vitesse. Le rapport 2026 associe trois résultats : la médaille d’or de Gemini Deep Think à l’IMO, 50,1 % de réponses correctes pour la lecture d’horloges analogiques par le meilleur modèle du panel, et environ 66 % de réussite sur OSWorld contre environ 12 % auparavant. Les chiffres sont datés de l’édition 2026 et portent sur des protocoles distincts.
| Mesure | Chiffre rapporté | Ce qu’elle teste | Ce qu’elle ne prouve pas |
|---|---|---|---|
| Lecture d’horloge | 50,1 % | Vision et raisonnement spatial sur une image | La compréhension de tous les documents métier |
| OSWorld | ≈ 66 % ; ≈ 12 % auparavant | Des tâches sur ordinateur et interfaces | L’autonomie sûre dans un compte de production |
| IMO | Niveau médaille d’or | Problèmes mathématiques de compétition | La qualité d’un agent CRM, support ou comptable |
Tableau original Minderlist, à partir de Stanford HAI 2026. Les protocoles, versions et modèles ne sont pas interchangeables.
Pourquoi ces résultats ne se contredisent pas
Une épreuve de mathématiques propose des règles explicites et une vérification structurée. OSWorld est plus proche d’une séquence opérationnelle : trouver une information, naviguer dans une application, modifier une interface. La lecture d’une horloge isole une difficulté de perception. Un même système peut être excellent sur l’une de ces tâches et fragile sur une autre.
La conséquence est concrète : un agent qui change un statut CRM ou déclenche un e-mail ne doit pas être évalué avec un benchmark de maths. Il faut mesurer son taux de réussite sur les cas attendus, puis examiner chaque échec. Une erreur de reformulation est récupérable ; une erreur de paiement ou de suppression ne l’est pas. Droits minimaux, journalisation, prévisualisation et validation humaine restent nécessaires.
Gemini, Claude ou GPT : une comparaison utile
La médaille IMO est documentée par Google DeepMind. C’est un signal solide pour le raisonnement mathématique de ce système précis, pas une victoire générale pour chaque offre Gemini. Claude et GPT sont des alternatives pertinentes dès que le besoin bascule vers le code, les documents, les outils ou des consignes françaises. Aucun des chiffres ci-dessus ne permet de les classer universellement.
| Critère | Comment départager les trois familles |
|---|---|
| Raisonnement | Donner les mêmes problèmes métier, demander les étapes vérifiables et noter les erreurs factuelles. |
| Code | Exécuter les tests de votre dépôt ; mesurer la correction, les régressions et la lisibilité du diff. |
| Multimodal | Tester les mêmes PDF, tableaux, images et captures, avec une réponse attendue connue. |
| Français | Inclure abréviations, vocabulaire métier, ambiguïtés et demandes mal formulées. |
| Vitesse et API | Mesurer la latence et le coût sur le même volume. Les tarifs changent : consulter les pages officielles de Claude et d’OpenAI avant un calcul. |
| Confidentialité | Vérifier l’offre et le contrat : les règles API, Team et Enterprise diffèrent. Voir notamment les engagements Enterprise d’OpenAI et la documentation Anthropic. |
Un protocole de test en français, en cinq étapes
- Préparez 20 à 50 cas anonymisés : e-mails, tickets, extraits de code, tableaux, PDF et captures réellement représentatifs.
- Écrivez la condition de réussite avant le test : réponse exacte, source, fichier valide, délai maximal, budget maximal et règle d’escalade.
- Utilisez le même prompt et les mêmes fichiers pour Gemini, Claude et GPT. Conservez les sorties ratées, pas seulement les démonstrations.
- Classez les erreurs par gravité : style, information erronée, action non demandée, fuite de donnée, action irréversible.
- Décidez tâche par tâche. Un modèle peut aider au brouillon mais ne pas recevoir le droit de publier ou modifier une donnée.
Ce que la hausse d’OSWorld prouve — et ne prouve pas
Le passage d’environ 12 % à environ 66 % constitue un changement important dans le benchmark. Il indique que les agents réussissent davantage de séquences sur ordinateur qu’auparavant. Il ne constitue pas un SLA : votre environnement inclut SSO, droits, pop-ups, données incomplètes et exceptions métier. Les nombres de Stanford sont des ordres de grandeur de benchmark ; ne les convertissez pas en promesse contractuelle.
Le site du benchmark OSWorld détaille son objectif : évaluer des agents dans des environnements informatiques. C’est une source méthodologique indispensable pour interpréter le score. Entre deux versions de modèle, les outils autorisés et les réglages peuvent aussi varier.
Pour qui cet écart est important
Achats et DSI : demandez un pilote sur vos flux, pas une capture de classement. Développeurs : gardez CI, revue humaine et scan de dépendances. Équipes SEO, support et opérations : commencez par les actions réversibles ; faites approuver publication, envoi et modification de données. Un modèle qui réussit une grande part de tâches sans gravité peut être utile ; le même taux est insuffisant si l’échec crée un dommage élevé.
Questions fréquentes
Un modèle médaillé à l’IMO est-il le meilleur pour mon entreprise ?
Non. Le résultat porte sur une épreuve donnée. Testez aussi vos documents, votre code, les actions d’interface, le prix et les règles de données.
66 % de réussite sur OSWorld suffit-il pour automatiser ?
Pas sans garde-fous. Le taux moyen ne donne pas le coût de chaque erreur ; les opérations sensibles doivent conserver une validation.
Quel modèle est le meilleur en français ?
Ces statistiques ne désignent pas un vainqueur universel. Comparez les mêmes cas français dans votre contexte et avec l’offre réellement contractée.
Où vérifier les prix API ?
Sur les grilles officielles, car les modèles, caches et fonctionnalités changent les prix.
Sources utiles
- Stanford HAI — AI Index Report 2026 (2026)
- Google DeepMind — Gemini à l’IMO (source primaire)
- OSWorld — documentation du benchmark (source primaire)
- Anthropic — prix API Claude (source primaire)
- OpenAI — tarification API (source primaire)
Vincent Vandegans écrit sur les outils, modèles et usages concrets de l’intelligence artificielle pour Minderlist.
