Verdict factuel. À performances comparables à GPT‑3.5, le coût d’inférence a été divisé par plus de 280 entre novembre 2022 et octobre 2024, selon l’AI Index Report 2025 de Stanford HAI. Ce chiffre rend les prototypes IA moins chers à tester. Il ne promet ni une facture basse, ni la rentabilité d’un agent en production.

Les trois points à retenir

  • Le repère Stanford passe d’environ 20 $ à 0,07 $ par million de tokens, pour un niveau GPT‑3.5.
  • Il s’agit du prix d’inférence, pas du coût d’entraînement ni du budget total d’un projet.
  • La série s’arrête en octobre 2024 : en septembre 2026, c’est la dernière édition complète du AI Index qui documente cette comparaison. Ce n’est pas un tarif actuel.

Le chiffre qui change l’équation des prototypes IA

Le graphique « AI inference cost » de l’AI Index 2025 compare le prix de requêtes à un système de niveau GPT‑3.5. Il situe ce prix autour de 20 $ par million de tokens en novembre 2022, puis autour de 0,07 $ en octobre 2024. Stanford résume l’écart à plus de 280 fois.

Mesure Valeur publiée Période et périmètre
Coût d’inférence, niveau GPT‑3.5 ~20 $ / million de tokens Novembre 2022 ; repère Stanford
Coût d’inférence, même niveau ~0,07 $ / million de tokens Octobre 2024 ; même série
Écart rapporté >280× moins cher Novembre 2022 → octobre 2024
Tableau de lecture réalisé à partir de Stanford HAI, AI Index Report 2025, p. 82. Les valeurs reprennent le graphique : ce ne sont ni une conversion en euros ni un devis fournisseur.

La conséquence pratique est précise : une équipe peut soumettre un classement de tickets, une extraction de documents ou une recherche sémantique à un volume réaliste avant de décider. En 2022, l’échantillon de test était plus souvent réduit à quelques cas. Un coût marginal plus faible permet de mesurer les erreurs sur davantage de données. La statistique ne dit pas que ces tâches sont fiables ; elle réduit le coût de les évaluer.

Ce que la statistique mesure — et ce qu’elle ne mesure pas

L’inférence est l’exécution d’un modèle déjà entraîné : une requête est envoyée, une réponse est générée. Le graphique ne mesure donc ni le coût de créer un modèle frontière, ni les salaires, ni l’intégration au système d’information. Il ne démontre pas non plus qu’un modèle actuel, plus capable, est vendu au prix du niveau GPT‑3.5.

Le dénominateur compte. Un million de tokens n’est pas un million de mots ; la correspondance varie selon la langue et la forme du texte. Les réponses longues, les PDF injectés dans le contexte et les relances d’agent augmentent les tokens. Comparer deux outils sur un prix « par requête » sans séparer entrée et sortie masque généralement le coût qui importe.

La fenêtre temporelle est aussi une limite. Le rapport Stanford a été publié en avril 2025 et le point final de cette série est octobre 2024. Nous l’employons faute d’équivalent 2026 documentant exactement la même comparaison. La série Inference Prices d’Epoch AI apporte une lecture méthodologique complémentaire, mais elle ne remplace jamais une grille contractuelle actualisée.

Comment convertir ce repère en budget

La question utile n’est pas « l’IA est-elle devenue bon marché ? », mais « combien de tokens et d’appels cette tâche génère-t-elle ? ». Pour un pilote, enregistrez pendant une semaine le modèle, les tokens d’entrée, les tokens de sortie, les appels d’outils, le taux d’échec et les minutes de validation humaine. Multipliez ensuite les volumes mesurés par la grille datée du fournisseur. Le résultat doit être présenté par ticket traité, dossier validé ou conversation résolue.

  • Extraction : séparez OCR, découpage des documents et modèle. Les gros dossiers coûtent surtout en contexte d’entrée.
  • Assistant interne : plafonnez la réponse et mesurez le cache quand il est proposé. Une base mal découpée peut coûter plus que la réponse affichée.
  • Agent : journalisez les boucles et appels d’outils. Dix petites décisions peuvent coûter davantage qu’une synthèse unique.
  • Production : ajoutez les retouches humaines. Le bon indicateur est le coût par résultat accepté, pas seulement celui par million de tokens.

Pourquoi les prix API ne se résument pas à une ligne

Les sources officielles détaillent des opérations distinctes. La tarification API d’OpenAI est organisée par modèle et tokens d’entrée/sortie. La documentation de prix de Claude distingue aussi les composantes et le cache. La page Vertex AI de Google Cloud documente ses tarifs et conditions pour les modèles génératifs. Ces références changent : datez votre calcul, notez le modèle exact et conservez l’URL consultée.

Décision À comparer Erreur fréquente
Choisir un modèle Qualité sur vos exemples, latence, entrée et sortie Ne retenir que le prix d’entrée
RAG / documents Contexte, cache, fréquence de mise à jour Compter seulement la réponse visible
Agent avec outils Étapes moyennes et échecs Budgéter un seul appel par tâche
Données sensibles Rétention, région, traitement Déduire la confidentialité du prix

Ce que cela change pour une petite équipe

Une baisse du coût d’inférence abaisse le prix d’entrée d’une expérimentation, pas le besoin de cadrage. Commencez par un résultat vérifiable : classer une demande, extraire un champ, préparer un brouillon ou résumer un dossier avec validation. Comparez une version sans IA, une version IA et le temps de correction. Si la qualité est insuffisante, un modèle moins cher qui produit plus de retouches n’est pas une économie.

Le prix ne renseigne pas à lui seul sur les données. Conservation des prompts, entraînement, région d’hébergement et contrôles d’entreprise sont des sujets distincts. Avant d’envoyer des données personnelles ou confidentielles, vérifiez les conditions de traitement et les paramètres de l’offre effectivement achetée. Un pilote sur données anonymisées permet de mesurer le coût sans élargir trop vite le périmètre.

Un test simple avant de généraliser

Avant de signer un engagement annuel, prenez un échantillon représentatif : des cas simples, des cas ambigus et des cas qui contiennent le vocabulaire métier. Définissez à l’avance ce qui compte comme une réponse acceptable. Pour chaque cas, gardez le prompt, le modèle, le volume de contexte, le nombre d’appels et le temps de vérification. Cette trace permet de distinguer une baisse de prix réelle d’un déplacement de coût vers la préparation des données ou la relecture.

Testez aussi une variante plus sobre : moins de documents injectés, une réponse plus courte ou une étape déterministe avant le modèle. Si cette variante conserve le même taux d’acceptation, elle réduit les tokens sans attribuer au modèle un travail qui relève d’une règle simple. À l’inverse, si elle dégrade les réponses sur les cas critiques, le gain apparent n’est pas une économie. Ces comparaisons internes ne remplacent pas la statistique Stanford ; elles répondent à une autre question, celle de votre coût opérationnel.

Limites à garder en tête

  • Le repère Stanford porte sur une capacité donnée, pas sur tous les modèles disponibles.
  • Les montants historiques sont en dollars et excluent infrastructure, outils et temps humain.
  • Les prix publics peuvent différer d’un contrat entreprise, d’une région ou d’un niveau de service.
  • Le chiffre décrit un passé mesuré ; il ne prédit pas le prix d’un projet en 2026.

Questions fréquentes

Le coût de l’IA a-t-il vraiment été divisé par plus de 280 ?

Pour l’inférence d’un système de niveau GPT‑3.5, Stanford HAI rapporte cet ordre de grandeur entre novembre 2022 et octobre 2024. Ce n’est pas un prix universel pour tous les modèles en 2026.

Comment estimer le coût d’un chatbot IA ?

Mesurez entrée, sortie, appels d’outils et taux de correction sur un échantillon réel, puis appliquez la grille datée du fournisseur. Restituez le résultat par conversation résolue.

Un prix API bas signifie-t-il que les données sont mieux protégées ?

Non. Prix, conservation, entraînement, localisation et contrôles d’entreprise sont distincts.

Sources utiles

Article rédigé par Vincent Vandegans pour Minderlist.

Rédigé par

vincent vandegans

Vincent est ingénieur , spécialisé en IA, il conseille les entreprises sur leur stratégie IA tant d'un côté technique qu'humain.