Vitesse des modèles IA :
qui finit le travail le plus vite
Un modèle qui réussit mieux n'est pas forcément celui qui vous fait gagner le plus de temps. Sur une tâche de développement confiée à un agent, le meilleur score peut demander une heure et demie là où un modèle moins fort rend sa copie en dix minutes ; relancé deux fois, ce dernier a souvent fini avant. Cette page mesure les deux : la réussite, et le temps qu'il faut pour l'obtenir.
Chaque chiffre porte sa date de relevé et sa source. Les mesures viennent d'évaluateurs tiers ; les indicateurs que nous en calculons sont signalés comme tels. Pour les tarifs, voir notre table des prix des modèles IA.
Réussite, temps et itérations sur des tâches agentiques
Chaque ligne est un couple agent + modèle + niveau d'effort, mesuré sur les mêmes tâches de développement. La réussite est le taux de tâches menées à bien du premier coup ; l'échec, son complément. Les étapes comptent les actions de l'agent (lecture de fichier, commande, édition) pour une tâche : c'est le nombre d'allers-retours que vous ne voyez pas.
Mesures : Coding Agent Index v1.5 (DeepSWE v1.1 (113 tâches), Terminal-Bench 4.0 (66) et SWE-Atlas-QnA (124), à poids égaux, pass@1 sur 3 tentatives), Artificial Analysis, relevé le 1er octobre 2026.
Comparer la vitesse des modèles, niveau d'effort par niveau d'effort
Choisissez un modèle et un niveau d'effort pour comparer sa réussite, sa durée, ses étapes et son débit à ceux des autres. Seuls les niveaux réellement mesurés sont proposés.
Toutes les mesures, classées par réussites par heure (31)
| Modèle | Effort | Agent | Réussite | Échec | Durée par tâche |
Étapes par tâche |
Réussites par heure |
Coût par tâche réussie |
|---|---|---|---|---|---|---|---|---|
| Claude Sonnet 5.5Anthropic | low | Claude Code | 42,1 % | 57,9 % | 6 min | 19 | 4,01 | 1,14 $ |
| GPT-6.1 SolOpenAI | low | Codex | 57,2 % | 42,8 % | 9 min | 36 | 3,99 | 0,87 $ |
| GPT-6.1 SolOpenAI Meilleur équilibre : à 7 points du meilleur score, plus de trois réussites par heure, et un coût par tâche réussie parmi les plus bas. | medium | Codex | 61,4 % | 38,6 % | 11 min | 38 | 3,38 | 1,14 $ |
| Claude Sonnet 5.5Anthropic | medium | Claude Code | 45,9 % | 54,1 % | 9 min | 22 | 3,24 | 1,35 $ |
| GPT-6.1 SolOpenAI | high | Codex | 60,1 % | 39,9 % | 13 min | 39 | 2,71 | 1,48 $ |
| Claude Sonnet 5.5Anthropic | high | Claude Code | 55,0 % | 45,0 % | 12 min | 37 | 2,68 | 2,25 $ |
| GPT-6.1 SolOpenAI | xhigh | Codex | 62,9 % | 37,1 % | 16 min | 40 | 2,43 | 1,65 $ |
| Gemini 3.8 FlashGoogle | high | Antigravity SDK | 41,9 % | 58,1 % | 12 min | 188 | 2,15 | 5,89 $ |
| Muse Spark 1.3Meta | max | Muse Code | 54,3 % | 45,7 % | 18 min | 185 | 1,77 | 7,33 $ |
| GPT-5.6 SolOpenAI | max | Codex | 54,6 % | 45,4 % | 21 min | 116 | 1,59 | 11,63 $ |
| Muse Spark 1.3Meta | xhigh | Muse Code | 48,3 % | 51,7 % | 18 min | 187 | 1,58 | 7,18 $ |
| GPT-6 SolOpenAI | max | Codex | 56,7 % | 43,3 % | 22 min | 87 | 1,53 | 5,27 $ |
| GPT-6.1 SolOpenAI | max | Codex | 60,1 % | 39,9 % | 24 min | 40 | 1,48 | 2,58 $ |
| Grok 4.6xAI | xhigh | Grok Build | 47,0 % | 53,0 % | 20 min | 112 | 1,45 | 7,60 $ |
| GPT-6 AstraOpenAI | xhigh | Devin Fusion CLIavec le modèle SWE-2 (medium) en appoint | 58,9 % | 41,1 % | 25 min | 79 | 1,43 | 7,71 $ |
| Claude Sonnet 5.5Anthropic | xhigh | Claude Code | 62,9 % | 37,1 % | 27 min | 78 | 1,40 | 5,29 $ |
| DeepSeek V4 Flash (0731)DeepSeek | max | Codex | 38,7 % | 61,3 % | 18 min | 122 | 1,27 | 0,23 $ |
| GPT-6 AstraOpenAI | max | Codex | 61,6 % | 38,4 % | 29 min | 39 | 1,26 | 12,13 $ |
| GPT-6 LunaOpenAI | max | Codex | 41,1 % | 58,9 % | 21 min | 89 | 1,15 | 0,44 $ |
| Gemini 4 ArgonGoogle | high | Antigravity CLI | 63,8 % | 36,2 % | 35 min | 149 | 1,11 | 9,15 $ |
| GPT-5.6 LunaOpenAI | max | Codex | 43,2 % | 56,8 % | 24 min | 122 | 1,10 | 1,02 $ |
| Claude Fable 5.1Anthropic | max | Claude Codeavec modèle de repli | 62,2 % | 37,8 % | 35 min | 37 | 1,07 | 19,92 $ |
| Claude Fable 5.1Anthropic | xhigh | Devin Fusion CLIavec le modèle SWE-2 (medium) en appoint | 61,7 % | 38,3 % | 36 min | 100 | 1,03 | 12,80 $ |
| Grok 4.7xAI | xhigh | Grok Build | 56,3 % | 43,7 % | 39 min | 163 | 0,86 | 15,67 $ |
| Claude Opus 5Anthropic | max | Claude Code | 59,7 % | 40,3 % | 42 min | 152 | 0,85 | 18,07 $ |
| GLM-5.3Z.ai | max | Opencode | 53,6 % | 46,4 % | 48 min | 107 | 0,67 | 7,91 $ |
| DeepSeek V4 Pro (0813)DeepSeek | max | Codex | 43,1 % | 56,9 % | 40 min | 138 | 0,64 | 0,56 $ |
| Claude Opus 5.5Anthropic | max | Claude Code | 66,0 % | 34,0 % | 65 min | 155 | 0,61 | 19,76 $ |
| Kimi K3Moonshot AI | par défaut | Kimi Code CLI | 51,9 % | 48,1 % | 62 min | 173 | 0,51 | 9,73 $ |
| Claude Sonnet 5.5Anthropic | max | Claude Code | 68,4 % | 31,6 % | 87 min | 266 | 0,47 | 20,75 $ |
| Qwen3.8 MaxAlibaba | par défaut | Claude Code | 43,3 % | 56,7 % | 63 min | 110 | 0,41 | 8,04 $ |
Réussites par heure : taux de réussite divisé par la durée moyenne d'une tâche, ramené à une heure. C'est notre calcul, pas une mesure de l'évaluateur. Il suppose qu'une tâche ratée est relancée avec les mêmes chances qu'au premier essai, ce qui est optimiste : en pratique, une tâche ratée l'est souvent pour une raison qui se répète. Coût par tâche réussie : coût moyen d'une tâche divisé par le taux de réussite.
Le classement par débit renverse le classement par score. Claude Sonnet 5.5 en effort maximal réussit le plus souvent (68,4 %) mais met 87 minutes par tâche : 0,47 réussite par heure. Le même modèle en effort bas réussit moins d'une fois sur deux (42,1 %), en 6 minutes : 4 réussites par heure, plus de huit fois plus. Muse Spark 1.3 illustre le compromis intermédiaire : 54,3 % de réussite, 185 étapes par tâche, mais 18 minutes seulement, soit 1,77 réussite par heure, près de quatre fois Sonnet 5.5 en effort maximal. GPT-6.1 Sol en effort moyen offre le meilleur équilibre mesuré : 61,4 % de réussite, 11 minutes, 1,14 $ par tâche réussie.
Vitesse brute : délai avant la réponse et débit d'écriture
Hors agent, sur une requête isolée. Le délai avant le premier mot de la réponse compte le temps de réflexion du modèle : c'est lui qui explose quand on monte le niveau d'effort. Le débit, en tokens par seconde, dit à quelle vitesse le texte s'écrit ensuite (un token vaut environ trois quarts de mot).
Mesures : mesures de latence et de débit (médianes sur la catégorie de requêtes longues, API de l'éditeur), Artificial Analysis, relevé le 1er octobre 2026.
| Modèle | Effort | Premier mot délai |
Réponse complète |
Débit tokens / s |
|---|---|---|---|---|
| Anthropic | ||||
| Claude Fable 5.1 | low | 4,5 s | 15 s | 47 |
| Claude Fable 5.1 | medium | 8,3 s | 19 s | 49 |
| Claude Fable 5.1 | high | 30 s | 40 s | 51 |
| Claude Fable 5.1 | xhigh | 1,6 min | 1,8 min | 59 |
| Claude Fable 5.1 | max | 4,3 min | 4,4 min | 68 |
| Claude Opus 5 | low | 3,0 s | 13 s | 48 |
| Claude Opus 5 | medium | 11 s | 21 s | 51 |
| Claude Opus 5 | high | 22 s | 32 s | 53 |
| Claude Opus 5 | xhigh | 51 s | 1,0 min | 51 |
| Claude Opus 5 | max | 1,1 min | 1,3 min | 52 |
| Claude Opus 5.5 | low | 13 s | 20 s | 72 |
| Claude Opus 5.5 | medium | 26 s | 33 s | 71 |
| Claude Opus 5.5 | high | 39 s | 46 s | 73 |
| Claude Opus 5.5 | xhigh | 2,2 min | 2,3 min | 78 |
| Claude Opus 5.5 | max | 11,9 min | 12,0 min | 90 |
| Claude Sonnet 5.5 | low | 1,2 s | 6,9 s | 88 |
| Claude Sonnet 5.5 | medium | 1,4 s | 6,8 s | 92 |
| Claude Sonnet 5.5 | high | 12 s | 18 s | 94 |
| Claude Sonnet 5.5 | xhigh | 33 s | 37 s | 103 |
| Claude Sonnet 5.5 | max | 6,8 min | 6,8 min | 139 |
| OpenAI | ||||
| GPT-5.6 Sol | sans raisonnement | 1,0 s | 8,6 s | 66 |
| GPT-5.6 Sol | low | 2,3 s | 9,8 s | 67 |
| GPT-5.6 Sol | medium | 7,2 s | 14 s | 70 |
| GPT-5.6 Sol | high | 16 s | 23 s | 74 |
| GPT-5.6 Sol | xhigh | 56 s | 1,0 min | 76 |
| GPT-5.6 Sol | max | 1,9 min | 2,0 min | 79 |
| GPT-6 Astra | low | 2,9 s | 14 s | 43 |
| GPT-6 Astra | medium | 6,2 s | 18 s | 44 |
| GPT-6 Astra | high | 1,1 min | 1,3 min | 43 |
| GPT-6 Astra | xhigh | 3,4 min | 3,6 min | 48 |
| GPT-6 Astra | max | 5,3 min | 5,5 min | 51 |
| GPT-6 Luna | sans raisonnement | 0,7 s | 4,5 s | 131 |
| GPT-6 Luna | low | 2,4 s | 6,8 s | 115 |
| GPT-6 Luna | high | 16 s | 20 s | 123 |
| GPT-6 Luna | xhigh | 24 s | 27 s | 131 |
| GPT-6 Luna | max | 2,0 min | 2,0 min | 125 |
| GPT-6.1 Sol | low | 3,1 s | 12 s | 60 |
| GPT-6.1 Sol | medium | 5,7 s | 15 s | 57 |
| GPT-6.1 Sol | high | 57 s | 1,1 min | 60 |
| GPT-6.1 Sol | xhigh | 1,8 min | 2,0 min | 57 |
| GPT-6.1 Sol | max | 4,9 min | 5,0 min | 64 |
| Gemini 3.7 Flash | low | 1,3 s | 3,1 s | 272 |
| Gemini 3.7 Flash | medium | 5,6 s | 7,5 s | 272 |
| Gemini 3.7 Flash | high | 11 s | 13 s | 291 |
| Gemini 3.8 Flash | high | 18 s | 20 s | 221 |
| xAI | ||||
| Grok 4.6 | low | 7,8 s | 16 s | 65 |
| Grok 4.6 | medium | 27 s | 35 s | 63 |
| Grok 4.6 | high | 35 s | 43 s | 68 |
| Grok 4.6 | xhigh | 31 s | 39 s | 65 |
| Grok 4.7 | high | 30 s | 37 s | 73 |
| Grok 4.7 | xhigh | 44 s | 51 s | 73 |
| Meta | ||||
| Muse Spark 1.3 | xhigh | 53 s | 56 s | 139 |
| Muse Spark 1.3 | max | 51 s | 55 s | 159 |
| Z.ai | ||||
| GLM-5.3 | low | 32 s | 39 s | 69 |
| GLM-5.3 | max | 33 s | 40 s | 68 |
| GLM-5.3-Flash | par défaut | 48 s | 59 s | 45 |
| Moonshot AI | ||||
| Kimi K3 | low | 1,0 min | 1,2 min | 36 |
| Kimi K3 | max | 1,0 min | 1,3 min | 34 |
| Alibaba | ||||
| Qwen3.8 Max | par défaut | 54 s | 1,1 min | 39 |
| DeepSeek | ||||
| DeepSeek V4 Pro (0813) | sans raisonnement | 2,0 s | 5,1 s | 162 |
| DeepSeek V4 Pro (0813) | max | 23 s | 28 s | 96 |
| DeepSeek V4.1 Flash | sans raisonnement | 1,0 s | 3,5 s | 199 |
| DeepSeek V4.1 Flash | max | 11 s | 13 s | 209 |
Le niveau d'effort pèse bien plus que le modèle. Claude Sonnet 5.5 répond en 1,2 seconde en effort bas et en près de 7 minutes en effort maximal ; Claude Opus 5.5 en effort maximal attend 12 minutes avant d'écrire le premier mot. Pour du travail interactif, un effort bas ou moyen est donc la première optimisation, avant tout changement de modèle. En débit pur, Gemini 3.7 Flash (272 à 291 tokens par seconde) et DeepSeek V4.1 Flash (environ 200) écrivent trois à six fois plus vite que les modèles haut de gamme d'Anthropic et d'OpenAI.
Quel profil pour quel usage
En binôme avec un développeur
Le développeur attend chaque réponse. Le délai avant le premier mot et la durée par tâche comptent plus que quelques points de réussite : effort bas ou moyen, et un modèle qui boucle vite quitte à relancer. GPT-6.1 Sol et Claude Sonnet 5.5 en effort bas ou moyen, ou Muse Spark 1.3, sont dans ce cas.
Une tâche longue lancée sans surveillance
Personne n'attend devant l'écran : une heure de calcul ne coûte rien en temps humain, un échec coûte une relecture. La réussite au premier essai prime. Claude Sonnet 5.5 et Opus 5.5 en effort maximal, ou Gemini 4 Argon, gagnent ici.
Un traitement en volume
Des centaines de petites tâches à enchaîner : le débit d'écriture et le coût par tâche réussie dominent. Les modèles Flash de Google et de DeepSeek écrivent le plus vite ; DeepSeek V4 Flash revient à 0,23 $ par tâche réussie.
Comment lire ces chiffres, et leurs limites
Les réussites par heure sont un calcul, pas une mesure
Elles supposent qu'on relance une tâche ratée avec les mêmes chances. Une tâche ratée pour une ambiguïté de la consigne ratera encore : le débit réel des modèles rapides est plus bas que ce chiffre.
Les étapes ne sont pas vos allers-retours
Ce sont les actions internes de l'agent. Les vôtres, relire et reformuler, n'apparaissent dans aucune mesure, et un modèle qui réussit moins souvent vous en demandera davantage.
La vitesse varie selon l'heure et l'hébergeur
Les débits et délais sont des médianes mesurées sur l'API de l'éditeur. L'écart autour de la médiane est large : pour Muse Spark 1.3, le débit va de 68 à 315 tokens par seconde entre les mesures les plus lentes et les plus rapides (5e et 95e centiles). Un autre hébergeur du même modèle peut aussi aller plus ou moins vite.
Vous pouvez citer cette page
Les données sont publiées sous licence CC BY 4.0 : reprenez les tables librement, y compris commercialement, en créditant la source.
Citation suggérée :
EpickOne, « Vitesse des modèles IA : qui finit le travail le plus vite », mis à jour le 1er octobre 2026. https://epickone.fr/vitesse-modeles-ia
Le bon réglage vaut souvent mieux qu'un autre modèle
Le niveau d'effort, l'agent qui pilote le modèle et la façon de découper le travail changent le temps de réponse bien plus que le choix du modèle. C'est ce que nous réglons quand nous intégrons l'IA dans vos outils, avec les prix des modèles en regard.
Diagnostic IA offert (30 min)