Vitesse des modèles IA :
qui finit le travail le plus vite

Mise à jour le 1er octobre 2026 Prochaine révision : 2 octobre 2026

Un modèle qui réussit mieux n'est pas forcément celui qui vous fait gagner le plus de temps. Sur une tâche de développement confiée à un agent, le meilleur score peut demander une heure et demie là où un modèle moins fort rend sa copie en dix minutes ; relancé deux fois, ce dernier a souvent fini avant. Cette page mesure les deux : la réussite, et le temps qu'il faut pour l'obtenir.

Chaque chiffre porte sa date de relevé et sa source. Les mesures viennent d'évaluateurs tiers ; les indicateurs que nous en calculons sont signalés comme tels. Pour les tarifs, voir notre table des prix des modèles IA.

Réussite, temps et itérations sur des tâches agentiques

Chaque ligne est un couple agent + modèle + niveau d'effort, mesuré sur les mêmes tâches de développement. La réussite est le taux de tâches menées à bien du premier coup ; l'échec, son complément. Les étapes comptent les actions de l'agent (lecture de fichier, commande, édition) pour une tâche : c'est le nombre d'allers-retours que vous ne voyez pas.

Mesures : Coding Agent Index v1.5 (DeepSWE v1.1 (113 tâches), Terminal-Bench 4.0 (66) et SWE-Atlas-QnA (124), à poids égaux, pass@1 sur 3 tentatives), Artificial Analysis, relevé le 1er octobre 2026.

Réussite au premier essai selon la durée d'une tâche Un point par couple agent + modèle + niveau d'effort. En haut à gauche : bon et rapide. Les lignes pointillées relient les points de même débit (réussites par heure). En orange : le meilleur équilibre, surligné dans le tableau.
Réussite au premier essai (%) en fonction de la durée moyenne d'une tâche (minutes) Nuage de 31 points. Le tableau qui suit donne les mêmes valeurs. 30 % 40 % 50 % 60 % 70 % 0 15 30 45 60 75 90 Durée moyenne d'une tâche (minutes) 0,5/h 1/h 2/h 4/h Claude Sonnet 5.5 (low, Claude Code) : 42,1 % de réussite, 6 min par tâche, 4,01 réussites par heure GPT-6.1 Sol (low, Codex) : 57,2 % de réussite, 9 min par tâche, 3,99 réussites par heure GPT-6.1 Sol (medium, Codex) : 61,4 % de réussite, 11 min par tâche, 3,38 réussites par heure Claude Sonnet 5.5 (medium, Claude Code) : 45,9 % de réussite, 9 min par tâche, 3,24 réussites par heure GPT-6.1 Sol (high, Codex) : 60,1 % de réussite, 13 min par tâche, 2,71 réussites par heure Claude Sonnet 5.5 (high, Claude Code) : 55,0 % de réussite, 12 min par tâche, 2,68 réussites par heure GPT-6.1 Sol (xhigh, Codex) : 62,9 % de réussite, 16 min par tâche, 2,43 réussites par heure Gemini 3.8 Flash (high, Antigravity SDK) : 41,9 % de réussite, 12 min par tâche, 2,15 réussites par heure Muse Spark 1.3 (max, Muse Code) : 54,3 % de réussite, 18 min par tâche, 1,77 réussites par heure GPT-5.6 Sol (max, Codex) : 54,6 % de réussite, 21 min par tâche, 1,59 réussites par heure Muse Spark 1.3 (xhigh, Muse Code) : 48,3 % de réussite, 18 min par tâche, 1,58 réussites par heure GPT-6 Sol (max, Codex) : 56,7 % de réussite, 22 min par tâche, 1,53 réussites par heure GPT-6.1 Sol (max, Codex) : 60,1 % de réussite, 24 min par tâche, 1,48 réussites par heure Grok 4.6 (xhigh, Grok Build) : 47,0 % de réussite, 20 min par tâche, 1,45 réussites par heure GPT-6 Astra (xhigh, Devin Fusion CLI) : 58,9 % de réussite, 25 min par tâche, 1,43 réussites par heure Claude Sonnet 5.5 (xhigh, Claude Code) : 62,9 % de réussite, 27 min par tâche, 1,40 réussites par heure DeepSeek V4 Flash (0731) (max, Codex) : 38,7 % de réussite, 18 min par tâche, 1,27 réussites par heure GPT-6 Astra (max, Codex) : 61,6 % de réussite, 29 min par tâche, 1,26 réussites par heure GPT-6 Luna (max, Codex) : 41,1 % de réussite, 21 min par tâche, 1,15 réussites par heure Gemini 4 Argon (high, Antigravity CLI) : 63,8 % de réussite, 35 min par tâche, 1,11 réussites par heure GPT-5.6 Luna (max, Codex) : 43,2 % de réussite, 24 min par tâche, 1,10 réussites par heure Claude Fable 5.1 (max, Claude Code) : 62,2 % de réussite, 35 min par tâche, 1,07 réussites par heure Claude Fable 5.1 (xhigh, Devin Fusion CLI) : 61,7 % de réussite, 36 min par tâche, 1,03 réussites par heure Grok 4.7 (xhigh, Grok Build) : 56,3 % de réussite, 39 min par tâche, 0,86 réussites par heure Claude Opus 5 (max, Claude Code) : 59,7 % de réussite, 42 min par tâche, 0,85 réussites par heure GLM-5.3 (max, Opencode) : 53,6 % de réussite, 48 min par tâche, 0,67 réussites par heure DeepSeek V4 Pro (0813) (max, Codex) : 43,1 % de réussite, 40 min par tâche, 0,64 réussites par heure Claude Opus 5.5 (max, Claude Code) : 66,0 % de réussite, 65 min par tâche, 0,61 réussites par heure Kimi K3 (par défaut, Kimi Code CLI) : 51,9 % de réussite, 62 min par tâche, 0,51 réussites par heure Claude Sonnet 5.5 (max, Claude Code) : 68,4 % de réussite, 87 min par tâche, 0,47 réussites par heure Qwen3.8 Max (par défaut, Claude Code) : 43,3 % de réussite, 63 min par tâche, 0,41 réussites par heure Claude Sonnet 5.5 (low) GPT-6.1 Sol (medium) Muse Spark 1.3 (max) Gemini 4 Argon (high) Claude Opus 5.5 (max) Claude Sonnet 5.5 (max)

Comparer la vitesse des modèles, niveau d'effort par niveau d'effort

Choisissez un modèle et un niveau d'effort pour comparer sa réussite, sa durée, ses étapes et son débit à ceux des autres. Seuls les niveaux réellement mesurés sont proposés.

Toutes les mesures, classées par réussites par heure (31)

Réussite, échec, durée, étapes, réussites par heure et coût par tâche réussie des couples agent + modèle + niveau d'effort, au 1er octobre 2026
Modèle Effort Agent Réussite Échec Durée
par tâche
Étapes
par tâche
Réussites
par heure
Coût
par tâche réussie
Claude Sonnet 5.5Anthropic low Claude Code 42,1 % 57,9 % 6 min 19 4,01 1,14 $
GPT-6.1 SolOpenAI low Codex 57,2 % 42,8 % 9 min 36 3,99 0,87 $
GPT-6.1 SolOpenAI Meilleur équilibre : à 7 points du meilleur score, plus de trois réussites par heure, et un coût par tâche réussie parmi les plus bas. medium Codex 61,4 % 38,6 % 11 min 38 3,38 1,14 $
Claude Sonnet 5.5Anthropic medium Claude Code 45,9 % 54,1 % 9 min 22 3,24 1,35 $
GPT-6.1 SolOpenAI high Codex 60,1 % 39,9 % 13 min 39 2,71 1,48 $
Claude Sonnet 5.5Anthropic high Claude Code 55,0 % 45,0 % 12 min 37 2,68 2,25 $
GPT-6.1 SolOpenAI xhigh Codex 62,9 % 37,1 % 16 min 40 2,43 1,65 $
Gemini 3.8 FlashGoogle high Antigravity SDK 41,9 % 58,1 % 12 min 188 2,15 5,89 $
Muse Spark 1.3Meta max Muse Code 54,3 % 45,7 % 18 min 185 1,77 7,33 $
GPT-5.6 SolOpenAI max Codex 54,6 % 45,4 % 21 min 116 1,59 11,63 $
Muse Spark 1.3Meta xhigh Muse Code 48,3 % 51,7 % 18 min 187 1,58 7,18 $
GPT-6 SolOpenAI max Codex 56,7 % 43,3 % 22 min 87 1,53 5,27 $
GPT-6.1 SolOpenAI max Codex 60,1 % 39,9 % 24 min 40 1,48 2,58 $
Grok 4.6xAI xhigh Grok Build 47,0 % 53,0 % 20 min 112 1,45 7,60 $
GPT-6 AstraOpenAI xhigh Devin Fusion CLIavec le modèle SWE-2 (medium) en appoint 58,9 % 41,1 % 25 min 79 1,43 7,71 $
Claude Sonnet 5.5Anthropic xhigh Claude Code 62,9 % 37,1 % 27 min 78 1,40 5,29 $
DeepSeek V4 Flash (0731)DeepSeek max Codex 38,7 % 61,3 % 18 min 122 1,27 0,23 $
GPT-6 AstraOpenAI max Codex 61,6 % 38,4 % 29 min 39 1,26 12,13 $
GPT-6 LunaOpenAI max Codex 41,1 % 58,9 % 21 min 89 1,15 0,44 $
Gemini 4 ArgonGoogle high Antigravity CLI 63,8 % 36,2 % 35 min 149 1,11 9,15 $
GPT-5.6 LunaOpenAI max Codex 43,2 % 56,8 % 24 min 122 1,10 1,02 $
Claude Fable 5.1Anthropic max Claude Codeavec modèle de repli 62,2 % 37,8 % 35 min 37 1,07 19,92 $
Claude Fable 5.1Anthropic xhigh Devin Fusion CLIavec le modèle SWE-2 (medium) en appoint 61,7 % 38,3 % 36 min 100 1,03 12,80 $
Grok 4.7xAI xhigh Grok Build 56,3 % 43,7 % 39 min 163 0,86 15,67 $
Claude Opus 5Anthropic max Claude Code 59,7 % 40,3 % 42 min 152 0,85 18,07 $
GLM-5.3Z.ai max Opencode 53,6 % 46,4 % 48 min 107 0,67 7,91 $
DeepSeek V4 Pro (0813)DeepSeek max Codex 43,1 % 56,9 % 40 min 138 0,64 0,56 $
Claude Opus 5.5Anthropic max Claude Code 66,0 % 34,0 % 65 min 155 0,61 19,76 $
Kimi K3Moonshot AI par défaut Kimi Code CLI 51,9 % 48,1 % 62 min 173 0,51 9,73 $
Claude Sonnet 5.5Anthropic max Claude Code 68,4 % 31,6 % 87 min 266 0,47 20,75 $
Qwen3.8 MaxAlibaba par défaut Claude Code 43,3 % 56,7 % 63 min 110 0,41 8,04 $

Réussites par heure : taux de réussite divisé par la durée moyenne d'une tâche, ramené à une heure. C'est notre calcul, pas une mesure de l'évaluateur. Il suppose qu'une tâche ratée est relancée avec les mêmes chances qu'au premier essai, ce qui est optimiste : en pratique, une tâche ratée l'est souvent pour une raison qui se répète. Coût par tâche réussie : coût moyen d'une tâche divisé par le taux de réussite.

Le classement par débit renverse le classement par score. Claude Sonnet 5.5 en effort maximal réussit le plus souvent (68,4 %) mais met 87 minutes par tâche : 0,47 réussite par heure. Le même modèle en effort bas réussit moins d'une fois sur deux (42,1 %), en 6 minutes : 4 réussites par heure, plus de huit fois plus. Muse Spark 1.3 illustre le compromis intermédiaire : 54,3 % de réussite, 185 étapes par tâche, mais 18 minutes seulement, soit 1,77 réussite par heure, près de quatre fois Sonnet 5.5 en effort maximal. GPT-6.1 Sol en effort moyen offre le meilleur équilibre mesuré : 61,4 % de réussite, 11 minutes, 1,14 $ par tâche réussie.

Vitesse brute : délai avant la réponse et débit d'écriture

Hors agent, sur une requête isolée. Le délai avant le premier mot de la réponse compte le temps de réflexion du modèle : c'est lui qui explose quand on monte le niveau d'effort. Le débit, en tokens par seconde, dit à quelle vitesse le texte s'écrit ensuite (un token vaut environ trois quarts de mot).

Mesures : mesures de latence et de débit (médianes sur la catégorie de requêtes longues, API de l'éditeur), Artificial Analysis, relevé le 1er octobre 2026.

Délai avant le premier mot, durée de la réponse complète et débit en tokens par seconde, par modèle et niveau d'effort, au 1er octobre 2026
Modèle Effort Premier mot
délai
Réponse
complète
Débit
tokens / s
Anthropic
Claude Fable 5.1 low 4,5 s 15 s 47
Claude Fable 5.1 medium 8,3 s 19 s 49
Claude Fable 5.1 high 30 s 40 s 51
Claude Fable 5.1 xhigh 1,6 min 1,8 min 59
Claude Fable 5.1 max 4,3 min 4,4 min 68
Claude Opus 5 low 3,0 s 13 s 48
Claude Opus 5 medium 11 s 21 s 51
Claude Opus 5 high 22 s 32 s 53
Claude Opus 5 xhigh 51 s 1,0 min 51
Claude Opus 5 max 1,1 min 1,3 min 52
Claude Opus 5.5 low 13 s 20 s 72
Claude Opus 5.5 medium 26 s 33 s 71
Claude Opus 5.5 high 39 s 46 s 73
Claude Opus 5.5 xhigh 2,2 min 2,3 min 78
Claude Opus 5.5 max 11,9 min 12,0 min 90
Claude Sonnet 5.5 low 1,2 s 6,9 s 88
Claude Sonnet 5.5 medium 1,4 s 6,8 s 92
Claude Sonnet 5.5 high 12 s 18 s 94
Claude Sonnet 5.5 xhigh 33 s 37 s 103
Claude Sonnet 5.5 max 6,8 min 6,8 min 139
OpenAI
GPT-5.6 Sol sans raisonnement 1,0 s 8,6 s 66
GPT-5.6 Sol low 2,3 s 9,8 s 67
GPT-5.6 Sol medium 7,2 s 14 s 70
GPT-5.6 Sol high 16 s 23 s 74
GPT-5.6 Sol xhigh 56 s 1,0 min 76
GPT-5.6 Sol max 1,9 min 2,0 min 79
GPT-6 Astra low 2,9 s 14 s 43
GPT-6 Astra medium 6,2 s 18 s 44
GPT-6 Astra high 1,1 min 1,3 min 43
GPT-6 Astra xhigh 3,4 min 3,6 min 48
GPT-6 Astra max 5,3 min 5,5 min 51
GPT-6 Luna sans raisonnement 0,7 s 4,5 s 131
GPT-6 Luna low 2,4 s 6,8 s 115
GPT-6 Luna high 16 s 20 s 123
GPT-6 Luna xhigh 24 s 27 s 131
GPT-6 Luna max 2,0 min 2,0 min 125
GPT-6.1 Sol low 3,1 s 12 s 60
GPT-6.1 Sol medium 5,7 s 15 s 57
GPT-6.1 Sol high 57 s 1,1 min 60
GPT-6.1 Sol xhigh 1,8 min 2,0 min 57
GPT-6.1 Sol max 4,9 min 5,0 min 64
Google
Gemini 3.7 Flash low 1,3 s 3,1 s 272
Gemini 3.7 Flash medium 5,6 s 7,5 s 272
Gemini 3.7 Flash high 11 s 13 s 291
Gemini 3.8 Flash high 18 s 20 s 221
xAI
Grok 4.6 low 7,8 s 16 s 65
Grok 4.6 medium 27 s 35 s 63
Grok 4.6 high 35 s 43 s 68
Grok 4.6 xhigh 31 s 39 s 65
Grok 4.7 high 30 s 37 s 73
Grok 4.7 xhigh 44 s 51 s 73
Meta
Muse Spark 1.3 xhigh 53 s 56 s 139
Muse Spark 1.3 max 51 s 55 s 159
Z.ai
GLM-5.3 low 32 s 39 s 69
GLM-5.3 max 33 s 40 s 68
GLM-5.3-Flash par défaut 48 s 59 s 45
Moonshot AI
Kimi K3 low 1,0 min 1,2 min 36
Kimi K3 max 1,0 min 1,3 min 34
Alibaba
Qwen3.8 Max par défaut 54 s 1,1 min 39
DeepSeek
DeepSeek V4 Pro (0813) sans raisonnement 2,0 s 5,1 s 162
DeepSeek V4 Pro (0813) max 23 s 28 s 96
DeepSeek V4.1 Flash sans raisonnement 1,0 s 3,5 s 199
DeepSeek V4.1 Flash max 11 s 13 s 209

Le niveau d'effort pèse bien plus que le modèle. Claude Sonnet 5.5 répond en 1,2 seconde en effort bas et en près de 7 minutes en effort maximal ; Claude Opus 5.5 en effort maximal attend 12 minutes avant d'écrire le premier mot. Pour du travail interactif, un effort bas ou moyen est donc la première optimisation, avant tout changement de modèle. En débit pur, Gemini 3.7 Flash (272 à 291 tokens par seconde) et DeepSeek V4.1 Flash (environ 200) écrivent trois à six fois plus vite que les modèles haut de gamme d'Anthropic et d'OpenAI.

Quel profil pour quel usage

En binôme avec un développeur

Le développeur attend chaque réponse. Le délai avant le premier mot et la durée par tâche comptent plus que quelques points de réussite : effort bas ou moyen, et un modèle qui boucle vite quitte à relancer. GPT-6.1 Sol et Claude Sonnet 5.5 en effort bas ou moyen, ou Muse Spark 1.3, sont dans ce cas.

Une tâche longue lancée sans surveillance

Personne n'attend devant l'écran : une heure de calcul ne coûte rien en temps humain, un échec coûte une relecture. La réussite au premier essai prime. Claude Sonnet 5.5 et Opus 5.5 en effort maximal, ou Gemini 4 Argon, gagnent ici.

Un traitement en volume

Des centaines de petites tâches à enchaîner : le débit d'écriture et le coût par tâche réussie dominent. Les modèles Flash de Google et de DeepSeek écrivent le plus vite ; DeepSeek V4 Flash revient à 0,23 $ par tâche réussie.

Comment lire ces chiffres, et leurs limites

Les réussites par heure sont un calcul, pas une mesure

Elles supposent qu'on relance une tâche ratée avec les mêmes chances. Une tâche ratée pour une ambiguïté de la consigne ratera encore : le débit réel des modèles rapides est plus bas que ce chiffre.

Les étapes ne sont pas vos allers-retours

Ce sont les actions internes de l'agent. Les vôtres, relire et reformuler, n'apparaissent dans aucune mesure, et un modèle qui réussit moins souvent vous en demandera davantage.

La vitesse varie selon l'heure et l'hébergeur

Les débits et délais sont des médianes mesurées sur l'API de l'éditeur. L'écart autour de la médiane est large : pour Muse Spark 1.3, le débit va de 68 à 315 tokens par seconde entre les mesures les plus lentes et les plus rapides (5e et 95e centiles). Un autre hébergeur du même modèle peut aussi aller plus ou moins vite.

Vous pouvez citer cette page

Les données sont publiées sous licence CC BY 4.0 : reprenez les tables librement, y compris commercialement, en créditant la source.

Citation suggérée :

EpickOne, « Vitesse des modèles IA : qui finit le travail le plus vite », mis à jour le 1er octobre 2026. https://epickone.fr/vitesse-modeles-ia

Le bon réglage vaut souvent mieux qu'un autre modèle

Le niveau d'effort, l'agent qui pilote le modèle et la façon de découper le travail changent le temps de réponse bien plus que le choix du modèle. C'est ce que nous réglons quand nous intégrons l'IA dans vos outils, avec les prix des modèles en regard.

Diagnostic IA offert (30 min)