Vous avez décidé de rendre vos procédures, contrats et comptes rendus interrogeables. Reste la question que tout le monde pose ensuite, et que les démonstrations éludent : quel modèle IA pour RAG choisir, et combien cela coûtera chaque mois ?
La question est mal posée, et c'est le premier piège. Un assistant documentaire fait travailler trois modèles l'un après l'autre : un modèle d'embeddings qui retrouve les passages, un reranker qui les trie, un LLM qui rédige la réponse. Ils ne coûtent pas la même chose. Ils ne pèsent pas pareil sur la qualité. Et le plus cher des trois n'est pas celui qui fait échouer les projets.
Voici la réponse brique par brique, avec des prix relevés le 7 octobre 2026 sur les grilles officielles des éditeurs.
Le cas d'usage, en deux lignes
Un assistant interne répond aux questions de vos équipes à partir de vos seuls documents, en citant ses sources. Nous avons expliqué le principe, les échecs classiques et les questions de confidentialité dans notre guide de l'assistant IA branché sur vos documents d'entreprise ; la mise en œuvre côté code est détaillée dans notre article sur la recherche sémantique avec Symfony AI et ChromaDB. Ici, on ne parle que du choix des modèles.
Un mot de maturité, pour rester honnête : le RAG est la technique de personnalisation la plus répandue en entreprise après la simple rédaction de consignes (Menlo Ventures, State of Generative AI in the Enterprise, décembre 2025). En France, 13 % des TPE-PME utilisent déjà l'IA pour analyser ou classer des documents (Baromètre France Num 2026, publié le 28 septembre 2026). Le besoin est réel ; beaucoup de projets en sont encore au prototype.
En bref, à jour au 7 octobre 2026. Pour rédiger les réponses, meilleur rapport qualité/prix : Gemini 3.8 Flash (0,75 / 3,75 $ par million de tokens, 84,0 % sur l'épreuve de lecture longue d'Artificial Analysis), environ 27 € par mois sur notre scénario. Son tarif double au 1er janvier 2027 : il reste alors raisonnable, à 55 €. Budget serré : GPT-6 Luna, raisonnement activé (83,3 % sur la même épreuve, 4 € par mois), mais aucune mesure publique de son taux d'hallucination à ce jour. Exigence maximale : Claude Opus 5.5 (84,7 %, 146 € par mois), le meilleur score parmi les modèles d'Anthropic, OpenAI, Google et Mistral. Pour retrouver les passages en français : voyage-4-large (0,12 $ par million de tokens), en tête du seul classement français de recherche documentaire publié. Indexer 3 000 documents coûte moins de 3 €. Le facteur qui décide de la qualité est ailleurs : la propreté du corpus et la consigne qui autorise le système à répondre « je ne sais pas ».
Où part l'argent : trois modèles, trois factures
Pour un assistant documentaire, la réponse à « quel modèle IA pour RAG » se décompose en trois choix, et les montants n'ont rien à voir entre eux.
Les embeddings transforment chaque passage de vos documents en vecteur. On paie une fois à l'indexation, puis quelques tokens par question. Sur un corpus de 3 000 documents de 8 000 tokens chacun, soit 24 millions de tokens, l'indexation complète coûte entre 0,48 $ (text-embedding-3-small d'OpenAI, 0,02 $ par million) et 4,80 $ (Gemini Embedding 2 de Google, 0,20 $). Une dépense ponctuelle, à refaire seulement quand le corpus change en profondeur.
Le reranker reprend la cinquantaine de passages remontés et les reclasse finement avant de les envoyer au LLM. Cohere facture Rerank 4 Fast 2 $ les 1 000 recherches ; Voyage estime le coût de son rerank-3, sorti le 30 septembre 2026, à 0,0025 $ par requête de 100 documents. Pour 2 500 questions par mois, comptez 5 à 6 $.
Le LLM lit les extraits et rédige. C'est lui qui pèse le plus sur la facture, parce qu'il reçoit à chaque question plusieurs milliers de tokens d'extraits.
Conséquence pratique : économiser sur les embeddings ne rapporte rien, quelques dollars par an. Mal choisir son modèle d'embeddings coûte cher autrement, en passages ratés que le meilleur LLM du monde ne pourra pas citer.
Retrouver le bon passage : les modèles d'embeddings
Le bon modèle d'embeddings, pour une PME française, est celui qui retrouve le passage pertinent dans des documents en français, avec des formulations qui ne reprennent pas les mots de la question. Trois critères suivent : la qualité de recherche en français, la longueur de texte acceptée par passage, et la possibilité de l'héberger soi-même quand les documents l'exigent.
Le classement de référence s'appelle MTEB. Sa partie française consacrée à la recherche documentaire, RTEB (fra), est encore en bêta, mais c'est le seul endroit où les modèles récents sont comparés sur du français.
| Modèle | RTEB français (recherche) | Prix / million de tokens | Texte max. par passage | Hébergement |
|---|---|---|---|---|
| voyage-4-large (Voyage AI) | 65,86 | 0,12 $ | 32 000 tokens | API |
| voyage-4 (Voyage AI) | 60,91 | 0,06 $ | 32 000 | API |
| Qwen3-Embedding-8B (Alibaba, Apache-2.0) | 59,51 | gratuit, à héberger | 32 000 | chez vous |
| gemini-embedding-001 (Google) | 58,36 | non affiché * | n.c. | API |
| text-embedding-3-large (OpenAI) | 56,86 | 0,13 $ | 8 192 | API |
| embed-v4.0 (Cohere) | 52,52 | non affiché ** | 128 000 | API |
| bge-m3 (BAAI, MIT) | 50,09 | gratuit, à héberger | 8 192 | chez vous |
| voyage-4-lite (Voyage AI) | 49,94 | 0,02 $ | 32 000 | API |
| text-embedding-3-small (OpenAI) | 44,22 | 0,02 $ | 8 192 | API |
Scores : leaderboard MTEB, benchmark RTEB(fra, beta), lu via l'API officielle du leaderboard le 7 octobre 2026. Prix et limites : pages officielles d'OpenAI, Voyage AI, Google et Cohere, consultées le même jour. * Google ne liste plus le prix de gemini-embedding-001, remplacé par Gemini Embedding 2 (0,20 $), qui n'a pas encore de score français complet. ** Cohere a lancé Embed 5 le 30 septembre 2026 (Fast à 0,08 $, Pro à 0,12 $) : pas encore classé.
Une réserve de taille, que le classement ne met pas en avant : la partie privée du benchmark est temporairement retirée de l'affichage (ticket mteb#3934). Le score visible repose donc sur un seul jeu de données public, médical. Les jeux juridiques et généralistes français existent dans les données mais ne comptent pas aujourd'hui, si bien que ces chiffres donnent un ordre d'arrivée sur du texte médical, sans rien dire de vos contrats ou vos procédures.
Ce que nous en retenons. voyage-4-large mène et coûte 2,88 $ pour indexer nos 24 millions de tokens : aucune raison d'économiser ici. text-embedding-3-small, souvent choisi par défaut parce qu'il est le moins cher et le plus documenté, arrive vingt points derrière ; c'est le choix par habitude que nous déconseillons sur du français. Et Qwen3-Embedding-8B, sous licence Apache-2.0, offre un vrai plan B quand les documents ne doivent pas sortir de vos serveurs : il fait mieux que l'offre haut de gamme d'OpenAI sur ce classement.
Attention aux licences des modèles « ouverts » : les poids de jina-embeddings-v5 sont publiés sous CC-BY-NC-4.0, qui interdit l'usage commercial sans licence achetée à part.
Le générateur : ce qui compte vraiment pour répondre juste
Pour la rédaction de la réponse, le meilleur modèle est celui qui lit correctement des extraits longs et n'ajoute rien qui n'y figure pas. Le reste, créativité, style, culture générale, sert peu dans un assistant documentaire.
Deux mesures publiques s'en approchent, chacune imparfaite :
- AA-LCR (Artificial Analysis, Long Context Reasoning) : 100 questions sur des documents de 10 000 à 100 000 tokens, qui obligent à croiser plusieurs passages. C'est l'épreuve la plus proche d'un RAG réel.
- Le classement d'hallucination de Vectara (HHEM) : la part de résumés qui contiennent une affirmation absente du document source. Il est mesuré en anglais et sur du résumé, pas sur des questions-réponses.
| Modèle | AA-LCR (lecture longue) | Hallucination Vectara | Contexte | Entrée / sortie ($ par Mtok) |
|---|---|---|---|---|
| Kimi K3 (max) | 88,7 % | non mesuré | > 1 M | 3,00 / 15,00 |
| Claude Opus 5.5 (max) | 84,7 % | non mesuré | 1 M | 4,00 / 20,00 |
| GPT-6.1 Sol (effort bas) | 84,0 % | non mesuré ° | 1,05 M | 2,00 / 10,00 |
| Gemini 3.8 Flash (medium) | 84,0 % | non mesuré | 1 M | 0,75 / 3,75 † |
| GPT-6 Luna (max) | 83,3 % | non mesuré | 1,05 M | 0,10 / 0,50 |
| Claude Sonnet 5.5 (max) | 82,7 % | non mesuré | 1 M | 2,00 / 10,00 |
| Gemini 3.1 Pro Preview | 82,0 % | 10,4 % | 1 M | 2,00 / 12,00 ‡ |
| Mistral Large 4 Preview | 81,3 % | non mesuré | 1 M selon Mistral § | 0,68 / 2,09 (promo) |
| Claude Haiku 4.5 (raisonnement) | 74,3 % | 9,8 % | 200 000 | 1,00 / 5,00 |
| Mistral Medium 3.5 | 69,3 % | non mesuré | 256 000 | 1,50 / 7,50 |
| Mistral Small 4 (raisonnement) | 49,7 % | non mesuré | 256 000 | 0,15 / 0,60 |
Sources : AA-LCR v1.1, Artificial Analysis et Vectara Hallucination Leaderboard (mis à jour le 22 septembre 2026), consultés le 7 octobre 2026. Prix et contextes : grilles officielles Anthropic, OpenAI, Google, Mistral et Moonshot AI, relevées les 6 et 7 octobre 2026. ° Son prédécesseur GPT-6 Sol affiche 6,5 % chez Vectara, le plus bas des grands éditeurs ; nous ne prêtons pas ce score au nouveau modèle. † Jusqu'au 31 décembre 2026, puis 1,50 / 7,50 $. ‡ Au-delà de 200 000 tokens dans la requête : 4 / 18 $. § Artificial Analysis indique 524 288 tokens pour la préversion.
Le premier enseignement saute aux yeux : entre le 2ᵉ et le 8ᵉ de ce tableau, il y a 3,4 points d'écart, et un facteur 40 sur le prix d'entrée. Sur la lecture de documents, les grands modèles ont convergé. Payer Opus 5.5 plutôt que Gemini 3.8 Flash achète 0,7 point.
Le deuxième est un piège de configuration. Le niveau de raisonnement compte plus que le nom du modèle : GPT-6 Luna passe de 83,3 % à 39,7 % quand on coupe le raisonnement, Claude Haiku 4.5 de 74,3 % à 49,7 %. Un « petit modèle » mal réglé perd ainsi plus de la moitié de ses bonnes réponses, et rien dans l'interface ne le signale à l'utilisateur.
Le troisième concerne la confiance. Le classement Vectara n'a pas encore mesuré la plupart des modèles sortis en septembre, et c'est pourtant le critère qui coûte le plus cher en cas d'erreur. Parmi les modèles actuels qu'il couvre, Claude Haiku 4.5 (9,8 %) devance Gemini 3.1 Pro Preview (10,4 %), et Mistral Large 3, la génération précédente, affiche 14,5 %. Ces taux portent sur du résumé, pas sur votre assistant. Dans un assistant, le premier levier se règle avant le choix du modèle : la consigne « réponds uniquement à partir des extraits, sinon dis que tu ne sais pas », que nous testons sur le jeu de questions de contrôle avant toute comparaison de modèles.
Sur Kimi K3, premier du classement : pour un assistant qui lit vos contrats et vos procédures, le lieu de traitement des données et les garanties contractuelles de l'éditeur passent avant quatre points de score. À vérifier avant tout essai. À l'inverse, Mistral Large 4 coche la case de l'éditeur européen à 81,3 %, pour un prix promotionnel dont Mistral n'affiche pas la date de fin.
Vous voulez savoir quel modèle répond juste sur vos propres documents ? Nous montons un prototype sur un échantillon de votre base, avec trente questions réelles et leurs bonnes réponses, et nous mesurons deux ou trois modèles côte à côte. Vous repartez avec des chiffres, pas avec une démonstration. Réserver votre diagnostic IA offert (30 min).
Combien coûte un assistant documentaire à votre volume
Prenons une PME qui ouvre l'assistant à une quarantaine de personnes : 2 500 questions par mois. Chaque question envoie au LLM la consigne système (2 000 tokens), huit extraits et la question (7 000 tokens), et reçoit 1 500 tokens de sortie, raisonnement compris. Soit 22,5 millions de tokens d'entrée et 3,75 millions de tokens de sortie par mois.
| Modèle générateur | Calcul | Coût mensuel |
|---|---|---|
| Claude Opus 5.5 | 22,5 × 4 $ + 3,75 × 20 $ = 165 $ | 146 € |
| Kimi K3 | 22,5 × 3 $ + 3,75 × 15 $ = 123,75 $ | 110 € |
| Gemini 3.1 Pro Preview | 22,5 × 2 $ + 3,75 × 12 $ = 90 $ | 80 € |
| GPT-6.1 Sol | 22,5 × 2 $ + 3,75 × 10 $ = 82,50 $ | 73 € |
| Claude Sonnet 5.5 | 22,5 × 2 $ + 3,75 × 10 $ = 82,50 $ | 73 € |
| Mistral Medium 3.5 | 22,5 × 1,50 $ + 3,75 × 7,50 $ = 61,88 $ | 55 € |
| Claude Haiku 4.5 | 22,5 × 1 $ + 3,75 × 5 $ = 41,25 $ | 37 € |
| Gemini 3.8 Flash | 22,5 × 0,75 $ + 3,75 × 3,75 $ = 30,94 $ | 27 € (55 € en 2027) |
| Mistral Large 4 (promo) | 22,5 × 0,68 $ + 3,75 × 2,09 $ = 23,14 $ | 21 € (41 € au prix plein) |
| GPT-6 Luna | 22,5 × 0,10 $ + 3,75 × 0,50 $ = 4,12 $ | 4 € |
Conversion au taux de référence BCE du 6 octobre 2026 (1 EUR = 1,1269 USD). Ajoutez 5 à 6 $ de reranker et moins de 3 $ d'indexation par passe complète du corpus.
Trois remarques que les simulateurs en ligne ne font pas.
Le cache rapporte peu sur un RAG. Contrairement à un assistant text-to-SQL, où le schéma de la base est identique à chaque question (nous l'avions chiffré dans notre comparatif des modèles pour le text-to-SQL), les extraits changent à chaque fois. Seule la consigne système se met en cache. Sur Claude Sonnet 5.5, cela fait passer la facture de 73 € à 65 € : utile, sans plus.
Un million de tokens n'est pas le même million partout. Chaque éditeur découpe le texte à sa façon, et le découpage change d'une génération à l'autre : Anthropic indique sur sa grille que ses modèles depuis Claude 4.7 produisent « environ 30 % de tokens en plus » pour le même texte que les précédents. À prix affiché identique, Claude Sonnet 5.5 et GPT-6.1 Sol ne coûtent donc pas forcément la même chose sur vos documents. Le seul chiffre fiable est celui que vous mesurez sur une semaine de vraies questions.
Gare aux offres gratuites. Sur la grille de Google, la ligne « utilisé pour améliorer nos produits » indique « oui » pour l'offre gratuite et « non » pour l'offre payante. Pour des documents internes, l'offre gratuite est hors sujet.
Ces montants évoluent : nous suivons chaque jour les tarifs des principaux éditeurs sur notre page Prix des modèles IA.
Le coût du modèle n'est pas votre budget. Entre 4 € et 146 € par mois pour 2 500 questions, l'inférence pèse moins qu'une demi-journée de travail. Ce qui coûte, et ce qui décide de la réussite, c'est le reste : nettoyer et dater le corpus, découper les documents intelligemment, filtrer les droits d'accès au moment de la recherche, constituer le jeu de questions de contrôle, surveiller les réponses en production. C'est ce travail d'intégration que nous chiffrons, comme une prestation d'ingénierie et non comme un abonnement. Les fourchettes par type de projet sont dans notre article sur le coût d'une intégration IA en PME.
Et si vous n'aviez pas besoin de RAG ?
Avec des fenêtres d'un million de tokens chez Anthropic, OpenAI, Google et Mistral, une autre option existe : envoyer tout le corpus au modèle à chaque question, et le mettre en cache.
Faisons le calcul pour un petit corpus de 150 000 tokens (une centaine de pages de procédures) avec Claude Sonnet 5.5, dont le contexte d'un million de tokens est facturé au tarif normal. Lecture du cache : 2 500 × 150 000 tokens × 0,20 $ par million = 75 $. Sortie : 37,50 $. Réécriture du cache quand il expire : comptons neuf fois par jour ouvré, soit environ 190 par mois, au tarif d'écriture d'une heure (4 $ par million, soit 0,60 $ l'écriture) : environ 114 $. Total : 226 $, soit environ 201 € par mois, contre 73 € pour le même modèle en RAG.
Presque trois fois plus cher à l'usage, donc. Mais sans base vectorielle à héberger, sans chaîne d'indexation à maintenir, sans passage raté par la recherche. Pour un corpus stable de quelques dizaines à quelques centaines de pages, ce surcoût de 130 € par mois est souvent inférieur au coût de développement et de maintenance d'un vrai RAG. Au-delà de quelques centaines de milliers de tokens, ou quand les documents changent chaque semaine, le RAG redevient le bon choix : le contexte plafonne, et chaque requête pleine paie le prix fort.
Quand le petit modèle suffit
- Questions factuelles sur un corpus propre (« quel est le délai de préavis du contrat X ? ») : Gemini 3.8 Flash ou GPT-6 Luna avec raisonnement activé font le travail. Montez en gamme seulement si votre jeu de contrôle montre des erreurs.
- Questions qui croisent plusieurs documents (« quelles clauses diffèrent entre nos trois contrats-cadres ? ») : c'est là que l'écart de lecture longue se paie, et qu'Opus 5.5 ou GPT-6.1 Sol justifient leur prix.
- Documents réglementés ou sensibles : le choix se fait d'abord sur l'hébergement. Un éditeur européen comme Mistral, ou un modèle ouvert hébergé chez vous, passe avant le dernier point de score. Nous avons détaillé ces arbitrages pour les cabinets juridiques.
Le raisonnement est le même que pour le code, où nous avions constaté que le classement change selon la longueur des tâches (notre comparatif pour la génération de code) : le bon modèle dépend de la difficulté réelle de vos questions, pas du haut du classement.
L'avis de Laurent, Directeur Général et développeur back-end chez EpickOne : « Quand on nous demande quel modèle mettre derrière un RAG, on commence par demander combien de pages fait le corpus. L'assistant de notre propre site n'a aucune base vectorielle : un document de référence rédigé à la main, injecté en entier à chaque conversation dans un modèle Claude Sonnet, avec une règle stricte, ce qui n'y figure pas n'existe pas. Pour un socle de cette taille, un RAG aurait ajouté du code, de l'hébergement et de la latence sans rien gagner en pertinence. Quand le volume impose un RAG, notre expérience sur la recherche sémantique est la même : la qualité se joue dans le découpage des documents et dans les filtres sur les métadonnées (date, service, statut du document), bien avant le choix du LLM. Le jour où un client hésite entre deux modèles, on ne tranche pas sur un classement : on les fait passer tous les deux sur ses trente questions. »
Ce qu'il faut retenir
Pour un assistant sur documents internes, la hiérarchie des choix est l'inverse de celle qu'on voit dans les comparatifs. Le modèle d'embeddings coûte quelques euros et mérite le haut de gamme, parce qu'un passage raté est perdu pour toujours. Le LLM coûte l'essentiel, mais les principaux modèles actuels se tiennent en 3,4 points sur la lecture de documents : Gemini 3.8 Flash suffit dans la plupart des cas, à condition de soigner son réglage. Et avant les deux, une question qui peut tout simplifier : votre corpus tient-il dans la fenêtre du modèle ?
Pour le cadre global de la démarche, de l'usage au choix technique, notre guide pour intégrer l'IA dans votre entreprise pose les étapes ; et si vous voulez que l'équipe qui calibre ces assistants documentaires regarde votre corpus, c'est en trente minutes.
Vous hésitez entre deux modèles, ou entre RAG et contexte long ? On regarde la taille et l'état de votre corpus, vos questions types et vos contraintes d'hébergement, et vous repartez avec une recommandation chiffrée. Réserver votre diagnostic IA offert (30 min).