
Verdict. Le débat « modèles ouverts contre modèles fermés » ne se résume plus à une intuition sur le prix ou la liberté. En mars 2026, le meilleur modèle fermé conservait une avance de 3,3 % sur le meilleur modèle ouvert dans l’indicateur suivi par le Stanford AI Index. En août 2024, cet écart n’était que de 0,5 %. Le signal est utile pour choisir une IA de code, de raisonnement ou multimodale, mais il ne prédit ni le coût total ni la confidentialité d’un projet.
Pour une équipe française, la bonne question est donc concrète : une API propriétaire apporte-t-elle assez de qualité et de vitesse pour justifier sa dépendance ? Ou des poids accessibles, hébergés chez soi ou par un prestataire, apportent-ils un contrôle qui vaut l’effort d’exploitation ? Cette analyse part des chiffres 2026, distingue ce qu’ils mesurent, puis propose un test décisionnel.
Les trois points à retenir
- Le meilleur fermé devançait le meilleur ouvert de 3,3 % en mars 2026, selon Stanford ; six modèles fermés figuraient dans les dix premiers du classement Arena cité.
- Un classement de préférences humaines n’est pas un test de code, de français, de documents métier ou de sécurité.
- Un modèle open weight peut réduire certains transferts de données ; il ne rend ni les GPU, ni la supervision, ni la mise à jour gratuits.
Le chiffre qui remet de la distance entre les deux familles
Le chapitre Performance technique de l’AI Index 2026 de Stanford date précisément son observation : en mars 2026, le meilleur modèle fermé a 3,3 % d’avance sur le meilleur modèle ouvert. Le rapport indique 0,5 % en août 2024 et six modèles fermés dans le top 10 Arena. Il constate aussi que l’écart entre le meilleur modèle américain et chinois est de 2,7 % à la même date.
| Indicateur | Valeur | Date et périmètre | Ce que cela ne prouve pas |
|---|---|---|---|
| Meilleur fermé vs meilleur ouvert | 3,3 % | Mars 2026, mesure rapportée par Stanford | Un gain identique sur votre tâche |
| Écart antérieur | 0,5 % | Août 2024, même comparaison rétrospective | Une tendance garantie |
| Fermés dans les dix premiers Arena | 6 sur 10 | Mars 2026 | Le coût, la conformité ou la latence |
| États-Unis vs Chine au sommet | 2,7 % | Mars 2026, Stanford | La qualité de tous les modèles des deux pays |
Tableau original de synthèse à partir du Stanford AI Index 2026.
Ces données sont une photographie de marché, pas un contrat de résultat. Stanford avertit également que les évaluations peuvent avoir des questions invalides : la revue citée va de 2 % sur MMLU Math à 42 % sur GSM8K. Un écart très fin doit donc déclencher un test interne, pas une décision automatique.
Ouvert, open weight, fermé : vérifier les droits avant la performance
« Ouvert » peut désigner des poids téléchargeables, une licence permissive, du code d’inférence public, ou un mélange de ces éléments. Ils ne vont pas forcément ensemble. Un modèle open weight permet d’exécuter des poids accessibles mais sa licence peut encadrer la redistribution ou certains usages. Une API fermée, elle, garde les poids côté fournisseur et facture les appels ; elle peut offrir une exploitation gérée, des contrôles de sécurité et un support contractuel.
Le guide officiel Qwen montre le chemin open weight : installation et exécution via les bibliothèques ou endpoints prévus par le modèle. À l’autre extrémité, les pages officielles de tarification API OpenAI et d’Anthropic détaillent une consommation selon le modèle et les volumes traités. Les tarifs évoluent : pour un budget, relevez la grille le jour du test et conservez-la avec les résultats.
Comparatif pratique : code, raisonnement, multimodal, français
| Critère | API fermée | Open weight | Test utile |
|---|---|---|---|
| Code | Intégration rapide et modèles gérés | Contrôle du runtime et du contexte | Correctifs acceptés et tests du dépôt |
| Raisonnement | Accès immédiat aux versions les plus récentes | Possibilité d’adapter le pipeline | Cas ambigus, réponses exactes et abstentions |
| Multimodal | Fonctions prêtes à appeler selon l’API | Support dépendant du modèle et du serveur | PDF, tableaux et images de votre métier |
| Français | Qualité variable selon le modèle | Qualité variable selon le modèle | Corpus français anonymisé, ton et citations |
| Confidentialité | Dépend du contrat et de la rétention | Dépend de l’hébergement et des accès | Cartographie des flux et journaux |
Pour le code, un leaderboard ne vérifie pas que le modèle respecte l’architecture d’un dépôt, lance les tests et s’arrête devant une modification dangereuse. Pour le raisonnement, mesurez les réponses justes mais aussi la capacité à dire qu’une pièce manque. Pour le multimodal, envoyez les scans, tableaux et PDF réellement rencontrés. Le français doit figurer dans le jeu d’essai, y compris les accents, dates, noms d’entités et consignes longues.
Pourquoi le classement Arena ne suffit pas
Le leaderboard LMArena est une source primaire utile pour suivre des préférences comparatives. Stanford s’en sert pour situer son constat. Mais il reflète un protocole et une population de votes, non un SLA d’entreprise. Il ne mesure pas directement votre conformité, vos coûts d’inférence, la disponibilité dans votre région ni la qualité de votre base documentaire.
Ce point explique une apparente contradiction : le meilleur fermé peut garder une avance au classement alors qu’un modèle ouvert est le meilleur choix pour une application isolée, à trafic stable et données sensibles. Inversement, une API peut être préférable lorsque le délai d’intégration, la capacité multimodale et le support l’emportent sur le contrôle de l’infrastructure.
Coût, vitesse et données : calculer le coût complet
Une API évite de réserver des GPU, de surveiller un serveur d’inférence et de planifier les mises à niveau. Son coût suit toutefois les requêtes, les entrées et les sorties ; comparez les prix officiels, le cache éventuel et les limites de débit. Un modèle ouvert peut rendre le coût marginal plus prévisible à volume élevé, mais les poids ne paient ni la capacité GPU, ni la disponibilité, ni l’observabilité, ni les sauvegardes.
La confidentialité ne se déduit pas non plus de l’étiquette. Demandez où les prompts transitent, combien de temps ils sont conservés, qui accède aux journaux et quelles options empêchent leur réutilisation. L’auto-hébergement limite certains transferts externes mais rend l’équipe responsable de la configuration et des correctifs. Une API peut convenir dans un cadre exigeant si sa documentation et son contrat correspondent au risque réel : il faut les vérifier au moment de signer.
Protocole de choix en cinq étapes
- Constituez 30 à 50 cas représentatifs et anonymisés, avec des échecs connus.
- Testez au moins une API fermée et un modèle open weight avec le même contexte, la même consigne et des paramètres fixes.
- Relevez séparément exactitude, citations, réussite des tests de code, latence et coût complet.
- Faites évaluer à l’aveugle par les personnes qui feront réellement le travail.
- Documentez rétention, accès, journalisation et plan de retour arrière avant le pilote.
Cette méthode donne un usage sain au 3,3 % : c’est un indicateur pour formuler une hypothèse, non une promesse. Une équipe peut accepter un écart de préférence si elle gagne en contrôle ; une autre peut choisir une API si les essais sur ses tâches confirment une meilleure qualité et un délai de mise en route acceptable.
Limites des données
La mesure Stanford est explicitement datée de mars 2026 : les sorties ultérieures peuvent changer le classement. Arena ne couvre pas tous les scénarios professionnels. Enfin, les licences et les capacités évoluent d’une version à l’autre. Il faut donc archiver version, date, paramètres et données de test ; sans cela, une comparaison ne peut pas être reproduite.
Questions fréquentes
Un modèle ouvert est-il forcément moins bon ?
Non. L’écart de 3,3 % porte sur les meilleurs modèles de chaque famille dans la photographie Stanford de mars 2026, pas sur votre cas d’usage.
Le premier d’un classement est-il le meilleur pour coder ?
Pas nécessairement. Testez-le sur un dépôt réel avec des tests automatisés, des règles de sécurité et une évaluation humaine.
Quel choix est le plus confidentiel ?
Tout dépend de l’hébergement, de la conservation et des accès. Lisez la documentation du fournisseur ou concevez l’exploitation de votre instance.
Peut-on comparer les prix par million de tokens ?
Oui, à condition d’ajouter les entrées, sorties, cache, matériel, temps d’exploitation et les tarifs datés.
Sources utiles
- Stanford HAI — AI Index 2026, performance technique (consulté le 30 septembre 2026)
- LMArena — leaderboard (consulté le 30 septembre 2026)
- Qwen — guide de démarrage
- OpenAI — tarification API
- Anthropic — tarification API
Article par Vincent Vandegans, pour Minderlist.
