Retour au blog | 10/10/2026 Intelligence Artificielle

Mistral Large 4 face à GPT, Claude et Gemini : performances, prix et vitesse

comparatif Mistral Mistral Large 4 Comparatif modèles IA Mistral Claude GPT Gemini IA souveraine

Le 6 octobre 2026, Mistral a ouvert la préversion de Mistral Large 4. Son surnom officieux, donné par Mistral elle-même dans l'annonce : « le Chonk ». C'est le plus gros modèle jamais publié par l'éditeur français, et le premier depuis longtemps qui se compare aux modèles fermés américains sur les épreuves agentiques.

Sans les dépasser pour autant. Ce comparatif répond à une question précise : où en est Mistral, en performance agentique, en raisonnement, en prix et en vitesse, face à OpenAI, Anthropic et Google ? Et puisqu'un score seul ne dit pas grand-chose, nous situons aussi Large 4 face aux modèles fermés des mois passés, pour mesurer le retard en temps plutôt qu'en points.

Toutes les mesures de performance viennent d'Artificial Analysis, évaluateur indépendant des éditeurs, consulté le 10 octobre 2026. Les prix viennent des grilles officielles, relevées le même jour.

En bref, au 10 octobre 2026. Indice général d'intelligence : 38,4 pour Mistral Large 4, contre 57,6 pour Claude Opus 5.5, le premier. C'est le niveau de GPT-5.5 (avril 2026) et de Claude Sonnet 5 (juin 2026) : environ six mois de retard sur la tête du classement. Agentique (Terminal-Bench 4.0) : 26,8 %, devant Claude Opus 4.8 de mai 2026 (21,7 %), mais loin de Claude Sonnet 5.5 (63,6 %) et de GPT-6.1 Sol (56,1 %). Le bond est historique pour Mistral : Mistral Medium 3.5, son meilleur modèle jusqu'ici, plafonnait à 14,2 sur le même indice. Prix : 0,68 $ / 2,09 $ par million de tokens en tarif promotionnel, le double au tarif normal. Raisonnable, mais Claude Haiku 5.5 fait mieux sur ces épreuves pour quatre à sept fois moins cher. Vitesse : 108 tokens par seconde, premier mot en 2,2 secondes. C'est son point fort le plus net. Sa vraie carte est ailleurs : un hébergement européen opéré par Mistral, et des poids ouverts annoncés pour la fin octobre.

Mistral Large 4 en quelques faits

D'après l'annonce de Mistral du 6 octobre 2026 :

  • un modèle de 1 000 milliards de paramètres, dont 52 milliards actifs à chaque token (architecture à experts), nativement multimodal (texte et images) ;
  • entraîné de zéro sur 3 800 GPU NVIDIA Grace Blackwell, dans les centres de données de Mistral en Europe, et servi sur la même infrastructure ;
  • une préversion d'API disponible sur Mistral Studio, avec un tarif promotionnel ;
  • des poids publiés « d'ici la fin du mois », ce qui permettra de l'héberger soi-même ;
  • plus de 160 langues dans les données d'entraînement, dont toutes les langues officielles de l'Union européenne.

Un point de vigilance, que Mistral écrit noir sur blanc : le modèle « continue de s'améliorer rapidement ». Les scores ci-dessous sont ceux de la préversion. Ils bougeront probablement d'ici la version finale.

D'où vient Mistral : un indice multiplié par 2,7

Pour mesurer le chemin parcouru, voici les principaux modèles Mistral sur l'indice d'intelligence d'Artificial Analysis. Cet indice agrège une dizaine d'épreuves (raisonnement, code, agents, connaissances, lecture longue) sur une échelle de 0 à 100.

Modèle Mistral Sortie Indice d'intelligence Terminal-Bench 2.1
Mistral Large 3 décembre 2025 9,3 12,0 %
Devstral 2 décembre 2025 8,6 30,3 %
Magistral Medium 1.2 septembre 2025 11,8 12,4 %
Mistral Small 4 (raisonnement) mars 2026 11,3 21,0 %
Mistral Medium 3.5 avril 2026 14,2 50,6 %
Mistral Large 4 (préversion) octobre 2026 38,4 non mesuré

Source : Artificial Analysis, consulté le 10 octobre 2026. Terminal-Bench 2.1 n'est plus mesuré sur les nouveaux modèles, d'où la case vide.

Le saut est considérable : de 14,2 à 38,4 en un peu plus de cinq mois. Mistral Medium 3.5 se défendait déjà sur certaines tâches d'agent simples (94,2 % sur τ²-Bench, qui simule un service client avec outils), mais restait à zéro sur Terminal-Bench 4.0, l'épreuve agentique la plus dure. Large 4 est le premier modèle Mistral à y marquer des points.

Face aux modèles fermés actuels

Le tableau qui suit compare Large 4 aux meilleurs modèles d'OpenAI, d'Anthropic et de Google, au réglage d'effort le plus élevé mesuré par Artificial Analysis. Terminal-Bench 4.0 fait travailler le modèle seul dans un terminal, sur 66 tâches longues : c'est notre mesure de référence de la performance agentique, la même que sur notre page Prix des modèles IA.

Modèle Éditeur Indice d'intelligence Terminal-Bench 4.0 Prix entrée / sortie ($ par M de tokens)
Claude Opus 5.5 Anthropic 57,6 59,6 % 4 / 20
Claude Sonnet 5.5 Anthropic 56,0 63,6 % 2 / 10
GPT-6 Astra OpenAI 52,7 59,1 % 10 / 50
Gemini 4 Argon Google 52,6 57,1 % accès restreint
GPT-6.1 Sol OpenAI 51,8 56,1 % 2 / 10
Claude Haiku 5.5 Anthropic 43,4 32,8 % 0,10 / 0,50
Gemini 3.8 Flash Google 40,9 19,7 % 0,75 / 3,75
Mistral Large 4 Mistral 38,4 26,8 % 0,68 / 2,09 (promo)
GPT-6 Luna OpenAI 38,1 12,6 % 0,10 / 0,50

Performances : Artificial Analysis, 10 octobre 2026, effort maximal sauf Gemini 4 Argon et Gemini 3.8 Flash (effort high). Prix : grilles officielles des éditeurs, relevées le 10 octobre 2026. Gemini 4 Argon n'est ouvert qu'à des testeurs : Google ne l'a pas encore mis dans la grille de son API.

Trois lectures.

Large 4 n'est pas un modèle de pointe. De 13 à 19 points d'indice le séparent des modèles haut de gamme, et de 29 à 37 points sur Terminal-Bench 4.0. Sur une tâche agentique longue, Claude Sonnet 5.5 réussit plus de deux fois plus souvent.

Il joue dans la catégorie des modèles intermédiaires. Il devance GPT-6 Luna et Gemini 3.8 Flash sur l'agentique, avec un indice général comparable.

Il est battu par Claude Haiku 5.5, sorti le 7 octobre, un jour après lui : 43,4 d'indice, 32,8 % sur Terminal-Bench 4.0, pour 0,10 $ et 0,50 $ par million de tokens.

Où en est Mistral par rapport aux anciens modèles fermés ?

C'est la question la plus parlante. Plutôt que « combien de points de retard », demandons : à quelle date les modèles fermés avaient-ils le niveau de Large 4 ?

Modèle fermé Sortie Indice d'intelligence Terminal-Bench 4.0
GPT-5 (high) août 2025 23,0 non mesuré
Claude Sonnet 4.5 (raisonnement) septembre 2025 20,7 0 %
Gemini 3 Pro (high) novembre 2025 28,0 non mesuré
Claude Opus 4.5 (raisonnement) novembre 2025 29,1 non mesuré
GPT-5.5 (xhigh) avril 2026 38,4 14,6 %
Claude Opus 4.8 mai 2026 41,8 21,7 %
Claude Sonnet 5 juin 2026 38,2 14,1 %
GPT-5.6 Sol juillet 2026 47,0 39,9 %
Claude Opus 5 juillet 2026 50,8 49,0 %
Mistral Large 4 octobre 2026 38,4 26,8 %

Source : Artificial Analysis, 10 octobre 2026. « Non mesuré » : l'épreuve n'existait pas encore ou n'a pas été passée sur ce modèle.

Sur l'indice général, Large 4 égale exactement GPT-5.5, sorti le 23 avril 2026, et dépasse nettement GPT-5, Claude Sonnet 4.5 ou Gemini 3 Pro, les références de fin 2025. Le retard sur la tête du classement est donc d'environ six mois. Six mois plus tôt, Mistral Medium 3.5 (14,2) se situait sous Gemini 2.5 Pro de juin 2025 (16,1) : le retard dépassait alors dix mois.

En agentique, le constat est un peu meilleur. Avec 26,8 % sur Terminal-Bench 4.0, Large 4 fait mieux que Claude Opus 4.8 de fin mai et que GPT-5.5. Il reste sous GPT-5.6 Sol et Claude Opus 5, sortis en juillet. Quatre mois de retard, donc.

Mistral publie de son côté 28,3 % sur la même épreuve. L'écart avec les 26,8 % d'Artificial Analysis est faible ; nous retenons la mesure indépendante.

Les autres domaines : raisonnement, lecture longue, vision, fiabilité

Épreuve (Artificial Analysis) Mistral Large 4 Claude Opus 5.5 GPT-6.1 Sol Claude Haiku 5.5 Gemini 3.8 Flash
Humanity's Last Exam (raisonnement expert) 35,0 % 61,4 % 52,9 % 44,4 % 47,8 %
SciCode (code scientifique) 54,2 % 66,9 % 54,2 % 55,0 % 56,6 %
AA-LCR (lecture de documents longs) 81,3 % 84,7 % 83,0 % 82,7 % 81,3 %
MMMU Pro (compréhension d'images) 76,4 % 87,7 % 86,0 % non mesuré 85,6 %
Taux d'hallucination (Omniscience) 41,9 % 58,6 % 54,3 % 40,4 % 55,2 %

Source : Artificial Analysis, 10 octobre 2026. Pour le taux d'hallucination, plus bas est meilleur : c'est la part des questions non maîtrisées où le modèle invente une réponse au lieu de reconnaître qu'il ne sait pas.

Le profil se dessine. Sur la lecture de documents longs et le code scientifique, Large 4 fait jeu égal avec des modèles bien plus récents ou plus chers : 81,3 % sur AA-LCR, soit 3,4 points sous Claude Opus 5.5 ; 54,2 % sur SciCode, à égalité avec GPT-6.1 Sol. Pour un assistant sur documents internes, c'est le critère qui compte (nous l'avons détaillé dans notre comparatif des modèles pour RAG).

Le raisonnement expert reste son point faible : 35,0 % sur Humanity's Last Exam, quand Opus 5.5 dépasse 61 %.

Côté fiabilité, une bonne surprise : avec 41,9 %, Large 4 invente moins souvent que Claude Opus 5.5 ou GPT-6.1 Sol quand il ne sait pas. Claude Haiku 5.5 fait à peine mieux (40,4 %) ; seul Gemini 4 Argon fait nettement mieux, à 15,1 %.

Sur la vision, Mistral affirme que Large 4 dépasse les modèles fermés de pointe en « visual grounding », la localisation précise d'éléments dans une image. Artificial Analysis ne mesure pas cette compétence ; sur MMMU Pro, plus général, Large 4 reste dix points derrière.

Prix : moins cher que les modèles de tête, pas que les petits

Grille officielle de Mistral, relevée le 10 octobre 2026 : 0,68 $ par million de tokens en entrée, 2,09 $ en sortie, 0,07 $ en lecture de cache, en tarif promotionnel. Le prix normal, affiché barré, est exactement le double (1,36 $, 4,18 $, 0,14 $). Mistral n'indique pas de date de fin pour la promotion.

Sur le scénario de notre page prix (trois développeurs, 500 sollicitations par mois chacun, 80 % de l'entrée servie depuis le cache), cela donne :

  • Mistral Large 4 : 19 € par mois au tarif promotionnel, 37 € au tarif normal ;
  • Claude Haiku 5.5 et GPT-6 Luna : 4 € ;
  • Gemini 3.8 Flash : 26 € ;
  • Claude Sonnet 5.5 et GPT-6.1 Sol : 66 € ;
  • Claude Opus 5.5 : 132 €.

Calcul et hypothèses détaillés sur Prix des modèles IA, tarifs et taux de change BCE du jour.

Autre mesure, celle d'Artificial Analysis : faire passer toute sa batterie d'épreuves à Large 4 a coûté 1 602 $ au tarif normal qu'il affiche, contre 330 $ pour Claude Haiku 5.5 et 1 082 $ pour GPT-6.1 Sol. Large 4 consomme donc beaucoup de tokens pour son niveau. Le tarif promotionnel divise ce coût par deux, ce qui le ramène dans la course, sans en faire une affaire.

Dans les gammes inférieures, Mistral reste très compétitif sur le prix : Mistral Small 4 à 0,15 $ / 0,60 $, Ministral 3 3B à 0,10 $ en entrée comme en sortie. Mais leurs scores (11,3 et 4,8 d'indice) les réservent à des tâches simples : classement, extraction, réponses courtes.

Vitesse : le point fort le plus net

Mesures d'Artificial Analysis relevées le 10 octobre 2026 pour notre page Vitesse des modèles IA, sur des requêtes longues, à l'effort par défaut de Large 4 :

Modèle (effort) Débit (tokens/s) Premier mot
Mistral Large 4 108 2,2 s
Claude Sonnet 5.5 (high) 108 11,9 s
Gemini 3.8 Flash (high) 124 26,8 s
Claude Haiku 5.5 (high) 184 22,5 s
Claude Opus 5.5 (high) 79 39,6 s
GPT-6.1 Sol (high) 52 61,0 s

Large 4 écrit aussi vite que Claude Sonnet 5.5, et il commence à répondre en un peu plus de deux secondes, quand les modèles concurrents réfléchissent de 12 secondes à une minute avant le premier mot. Pour un assistant conversationnel ou un outil interactif, cette réactivité se sent tout de suite. La comparaison a ses limites : en effort bas, Claude Sonnet 5.5 répond lui aussi en moins d'une seconde.

La contrepartie probable se lit dans les tableaux précédents : un modèle qui réfléchit peu avant de répondre perd des points sur les tâches les plus dures.

Quand choisir Mistral, et quand s'en passer

Mistral Large 4 a du sens si :

  • l'hébergement compte plus que le dernier point de score. Mistral propose un déploiement européen qu'elle opère de bout en bout, « indépendamment des autres fournisseurs de services numériques et sous droit européen » (annonce du 6 octobre). Pour des données de santé, juridiques ou publiques, c'est souvent le premier critère.
  • vous voulez héberger le modèle vous-même. Si les poids sortent bien fin octobre, Large 4 deviendra, selon Mistral, le modèle ouvert le plus capable conçu en Europe ou aux États-Unis. Un modèle de 1 000 milliards de paramètres demande toutefois une infrastructure lourde : ce n'est pas un modèle pour un serveur de bureau.
  • la réactivité prime : chat, assistant intégré à un outil métier, réponses en direct.
  • vous travaillez sur des documents longs, où il tient la comparaison avec les meilleurs.

Il vaut mieux regarder ailleurs si :

  • vous confiez des tâches longues en autonomie (agent de code, automatisation multi-étapes) : Claude Sonnet 5.5 et GPT-6.1 Sol réussissent deux fois plus souvent, pour 66 € par mois sur notre scénario. Notre comparatif des modèles pour générer du code détaille ce cas.
  • votre budget est serré et vos données peuvent aller aux États-Unis : Claude Haiku 5.5 fait mieux pour moins cher.

En cybersécurité, Mistral met en avant un argument particulier : là où des modèles fermés refusent certaines tâches de reproduction de failles, Large 4 les exécute, avec 82 % sur l'une de ces épreuves selon l'éditeur. Nous n'avons pas de mesure indépendante pour le confirmer : à vérifier sur vos propres cas avant d'en faire un critère.

Ce que nous ne savons pas encore

  • Les scores définitifs. C'est une préversion : Mistral annonce des améliorations, une architecture détaillée et de nouveaux benchmarks avec la sortie des poids.
  • Le classement en génération d'interfaces. Large 4 n'est pas encore classé sur Design Arena.
  • La durée du tarif promotionnel, sans date de fin affichée.
  • Le coût réel en auto-hébergement, qui dépendra du matériel et du volume.

Nous mettons à jour Prix des modèles IA et Vitesse des modèles IA chaque jour : les nouvelles mesures de Large 4 y apparaîtront dès leur publication.

Ce qu'il faut retenir

Mistral Large 4 est la meilleure nouvelle pour Mistral depuis longtemps : un indice multiplié par 2,7 en un peu plus de cinq mois, un retard ramené d'environ dix mois à environ six sur les modèles fermés, et une vitesse de réponse que peu de concurrents égalent. Ce n'est pas un rival de Claude Opus 5.5 ou de GPT-6.1 Sol sur l'agentique. Il atteint le niveau des modèles fermés du printemps 2026, avec deux atouts qu'aucun d'eux n'a : une infrastructure européenne et des poids bientôt ouverts.

Le coût du modèle reste la plus petite ligne du budget, entre 4 € et 132 € par mois. Ce qui décide du résultat, c'est l'intégration : quel modèle pour quelle tâche, quelles données sortent de chez vous, comment on vérifie les réponses. Si vous voulez qu'une équipe qui intègre ces modèles au quotidien regarde votre cas, comptez trente minutes.

Vous hésitez entre Mistral et un modèle américain ? On regarde vos données, vos contraintes d'hébergement et vos tâches types, et vous repartez avec une recommandation chiffrée. Réserver votre diagnostic IA offert (30 min).