Prix des modèles IA :
la table de référence
Combien coûte réellement chaque modèle d'IA, et que vaut-il ? Les grilles tarifaires des éditeurs sont éparpillées, changent sans préavis et ne disent rien de la qualité. Cette page rassemble les deux, en un seul endroit, et la tient à jour tous les mois.
Chaque chiffre porte sa date de relevé et sa source primaire. Les scores viennent d'évaluateurs tiers, indépendants des éditeurs — jamais des communiqués de ces derniers. Quand une donnée manque, la case reste vide plutôt qu'estimée.
Prix des grands modèles de langage
Tarifs officiels en dollars par million de tokens. La colonne « score » situe chaque modèle sur une épreuve de code menée par un évaluateur tiers, indépendant des éditeurs — c'est le seul classement pour lequel nous disposons d'une source primaire vérifiable à cette date.
Score : Terminal-Bench v2.1 (harness Terminus 2, pass@1 moyenné sur 3 essais) — Artificial Analysis. Tarifs officiels et scores relevés le 5 août 2026.
| Modèle | Score | Entrée $ / M tokens |
Sortie $ / M tokens |
3 devs € / mois |
|---|---|---|---|---|
| GPT-5.6 Sol (effort xhigh) OpenAI | 89,5 % | 5,00 $ | 30,00 $ | 190 € |
| Claude Opus 5 Anthropic | 89,1 % | 5,00 $ | 25,00 $ | 184 € |
| Kimi K3 Moonshot AI Contexte de plus d'un million de tokens. | 85,0 % | 3,00 $ | 15,00 $ | 102 € |
| Claude Fable 5 Anthropic | 84,6 % | 10,00 $ | 50,00 $ | 367 € |
| Grok 4.5 (effort high) xAI Meilleur rapport score/prix de la table. | 81,6 % | 2,00 $ | 6,00 $ | 57 € |
| Claude Sonnet 5 Anthropic Tarif relevé au 1er septembre 2026, à l'expiration du tarif introductif (2,00 / 10,00 $, soit 73 €) en vigueur jusqu'au 31 août. | 80,5 % | 3,00 $ | 15,00 $ | 110 € |
| DeepSeek V4 Flash DeepSeek | 78,7 % | 0,14 $ | 0,28 $ | 3 € |
| GLM-5.2 Z.ai | 77,9 % | 1,40 $ | 4,40 $ | 43 € |
| Gemini 3.6 Flash Google | 77,5 % | 1,50 $ | 7,50 $ | 51 € |
| Qwen3.7 Max Alibaba | 74,5 % | — | — | — |
| Claude Haiku 4.5 Anthropic | 44,2 % | 1,00 $ | 5,00 $ | 37 € |
Coût mensuel calculé pour 3 développeurs : 500 sollicitations par mois et par développeur, 40 000 tokens d'entrée chacune dont 80 % servis depuis le cache, 3 000 tokens de sortie (tokens de raisonnement compris, facturés au tarif de sortie).
Conversions au taux de référence BCE du 4 août 2026 (1 USD = 0,8684 EUR) ; aucun de ces éditeurs ne publie de grille en euros.
Tâches longues : le classement se renverse
Un modèle qui répond bien à une question isolée n'est pas un modèle capable de mener une tâche à terme. Cet index mesure des tâches agentiques complètes ; chaque ligne associe un modèle ET l'agent qui le pilote.
Index Coding Agent v1.3 (DeepSWE (113 tâches), Terminal-Bench v2 (84) et SWE-Atlas-QnA (124), à poids égaux, pass@1 sur 3 tentatives) — Artificial Analysis, relevé le 5 août 2026.
| Agent + modèle | Score agentique | Coût / tâche | Rappel Terminal-Bench |
|---|---|---|---|
| Claude Code + Claude Opus 5 (xhigh) | 67 | 8,23 $ | 89,1 % |
| Codex + GPT-5.6 Sol (max) | 67 | 7,08 $ | 89,5 % |
| Claude Code + Claude Fable 5 (max) | 66 | 11,70 $ | 84,6 % |
| Grok Build + Grok 4.5 (high) | 64 | — | 81,6 % |
| Kimi Code CLI + Kimi K3 | 61 | — | 85,0 % |
| Opencode + Muse Spark 1.1 | 54 | — | 77,9 % |
| Claude Code + GLM-5.2 | 43 | — | 77,9 % |
| Cursor CLI + Composer 2.5 Fast | 38 | — | — |
| Claude Code + DeepSeek V4 Pro (high) Rappel mesuré sur V4 Flash. | 31 | 0,27 $ | 78,7 % |
| Gemini CLI + Gemini 3.1 Pro (high) | 30 | 2,00 $ | — |
Comparez les deux dernières colonnes : c'est l'information la plus utile de cette page. GLM-5.2 et Muse Spark obtiennent le même score sur Terminal-Bench, mais 54 contre 43 en agentique. DeepSeek et Gemini tiennent sur des tâches courtes, puis tombent à 31 et 30 dès qu'il faut enchaîner des outils sur la durée. Économiser sur le modèle en agentique est un faux calcul : trente fois moins cher à la tâche, mais deux fois moins de réussites — rapporté à la tâche effectivement terminée, l'écart fond.
Prix des moteurs de transcription audio
Le WER (taux d'erreur de mots) est donné sur audio propre puis bruité — c'est le second chiffre qui compte pour une salle de réunion.
Relevé le 1er juillet 2026.
| Moteur | WER propre / bruité |
Français | Diarisation | Latence | Prix / heure d'audio |
|---|---|---|---|---|---|
| AssemblyAI Universal-2 / 3 Pro | 2,1 % / 7,9 % | bon | Oui | ~1,1 s | 0,15–0,23 $/h |
| Deepgram Nova-3 | 2,5 % / 8,2 % | bon (modèle multilingue) | Oui (+ option) | ~0,45 s — le plus rapide | 0,55 $/h + 0,12 $/h diarisation |
| OpenAI gpt-4o-transcribe | haut de gamme | bon | Option, même prix | moyenne | 0,36 $/h (mini : 0,18 $/h) |
| Google Gemini 2.5 Pro | 2,3 % / 8,7 % | bon | Non (en natif) | ~3,8 s | au token audio (ordre comparable) |
| Whisper large-v3 open source | 2,8 % / 11,4 % | 4–7 % (WER) | Non (à ajouter) | ~4,2 s (différé) | licence gratuite — coût = votre infra (ou 0,36 $/h via l'API OpenAI) |
Trois leviers qui changent la facture d'un facteur 2 à 12
Traitement par lots
Chez Anthropic, OpenAI, Google et Mistral, pour tout ce qui n'est pas interactif : revue de code nocturne, génération de tests, documentation.
Seuils de contexte long
Chez OpenAI, le prix d'entrée double sur la totalité de la session au-delà de 272 000 tokens. Chez xAI et Google, tout l'appel bascule au-delà de 200 000.
Résidence des données
Surcoût constaté chez OpenAI et Google pour garantir la localisation des traitements.
Abonnements développeur, pour 3 sièges à l'année
L'alternative à l'API. Le prix inclut l'intégration IDE, la revue de pull requests et la gestion des sièges.
Relevé le 5 août 2026.
Comment lire ces chiffres — et pourquoi s'en méfier
Les prix proviennent des grilles publiques des éditeurs, relevées à la date indiquée sous chaque table. Les scores proviennent d'évaluateurs tiers indépendants : nous ne reprenons jamais un score annoncé par l'éditeur du modèle qu'il mesure. Quand une donnée n'est pas publique, la case reste vide.
Un score de code sans son harness, son niveau d'effort et sa source ne veut rien dire. Voici les trois raisons pour lesquelles il faut lire n'importe quel classement de modèles, y compris celui-ci, avec précaution.
Le même modèle change de score selon l'agent qui l'exécute
Qwen3-Coder-480B obtient 69,60 % sur SWE-bench avec le harness OpenHands et 55,40 % avec mini-SWE-agent : 14,2 points d'écart à modèle identique. C'est plus que l'écart entre le premier et le cinquième de notre table agentique. Changer de modèle sans changer d'agent, c'est optimiser la mauvaise variable.
leaderboard swebench.comLe même couple modèle-benchmark donne trois valeurs selon qui mesure
GPT-5.5 sur Terminal-Bench 2.1 : 83,1 % sur le leaderboard officiel, 83,4 % selon Anthropic, 85,6 % selon OpenAI. Aucun n'est faux ; les conditions diffèrent.
tbench.aiLe benchmark historique a été abandonné par ceux qui l'utilisaient
En février 2026, OpenAI a cessé de publier ses scores SWE-bench Verified : sur 138 instances auditées par au moins six ingénieurs, 59,4 % présentaient des tests défectueux. Le leaderboard officiel n'enregistre plus aucune entrée depuis le 26 février 2026 — les scores SWE-bench affichés sur les modèles récents ne viennent d'aucune source primaire.
OpenAI, 23 février 2026Vous pouvez citer cette page
Les données sont publiées sous licence CC BY 4.0 : reprenez les tables librement, y compris commercialement, en créditant la source.
Citation suggérée :
EpickOne, « Prix des modèles IA : la table de référence », mis à jour le 1er septembre 2026. https://epickone.fr/prix-modeles-ia
Un chiffre vous semble faux ou périmé ? Signalez-le — on corrige et on vous répond.
Comparatifs détaillés par cas d'usage
Cette page donne les prix et les scores bruts. Pour savoir quel modèle choisir sur un besoin précis — et pourquoi le moins cher gagne parfois — chaque cas d'usage a son analyse dédiée, publiée le premier mercredi du mois.
Transcrire et résumer des réunions
Précision en français, diarisation et coût réel à l'heure d'audio.
Générer et relire du code
Assistance ponctuelle et tâches agentiques longues : deux classements qui ne désignent pas le même gagnant.
Pour le contexte général, lisez notre guide d'intégration de l'IA en entreprise pour dirigeants, ou découvrez notre approche sur la page Projet IA.
Le coût du modèle n'est pas votre budget
Entre 3 € et 190 € par mois pour trois développeurs, le moteur n'est plus le poste de dépense. Ce qui coûte — et ce qui crée la valeur — c'est ce qu'il y a autour : les règles qui empêchent l'IA de produire hors normes, les tests qui rattrapent ce qu'elle casse, et la garantie que vos données ne partent pas nourrir un modèle tiers.
Diagnostic IA offert (30 min)