Prix d'un RAG en 2026 : le coût complet (TCO) PME
TL;DR : Pour une PME, un chatbot documentaire (RAG) coûte 5 000 à 50 000 € à construire, plus 200 à 3 000 € par mois à faire tourner, selon la grille Koïno 2026 et les baromètres français. Le prix dépend de la taille du corpus, de la finesse des droits d'accès et du choix cloud ou souverain. Le vrai budget n'est pas le build : le run et l'évaluation continue pèsent souvent la moitié du coût sur trois ans.
À retenir
- Fourchette PME : 5 000 à 50 000 € de mise en place, 200 à 3 000 € par mois de fonctionnement (grille Koïno 2026 et baromètres La Fabrique du Net, Stema, Fenxi).
- Sept postes font le prix : cadrage, préparation et ingestion des données, base vectorielle, LLM et tokens, intégration au SI, gestion des droits, run.
- Les tokens sont rarement le poste dominant à l'échelle PME : les embeddings coûtent 0,02 à 0,13 $ par million de tokens, l'essentiel du run est humain.
- Un RAG souverain on-premise coûte plus (serveur GPU dès environ 1 440 $ par mois, plus l'exploitation) mais garde vos données dans votre réseau.
- Règle du TCO : multipliez le devis de build par environ 1,5 pour obtenir le coût réel sur trois ans, run et évaluation compris.
- Les coûts cachés ne sont pas techniques : qualité documentaire, évaluation continue et réindexation décident du succès.
La question que tout dirigeant pose en premier, « combien coûte un RAG ? », porte sur la partie la moins chère du projet. Construire un chatbot sur vos documents se chiffre au plus en dizaines de milliers d'euros. Le faire répondre juste pendant trois ans, avec des documents qui changent et des équipes qui l'utilisent vraiment, coûte souvent davantage. Ce guide chiffre les deux, setup et run, poste par poste, avec les fourchettes du marché français et les prix réels de l'infrastructure.
Qu'est-ce qu'un RAG (chatbot documentaire) ?
Un RAG, pour retrieval augmented generation (génération augmentée par récupération), est une architecture qui connecte un modèle de langage à vos documents internes pour qu'il réponde à partir de ces sources, et non de ses seules connaissances générales. Concrètement, c'est un chatbot documentaire : il retrouve les passages pertinents dans votre base, les transmet au modèle, et celui-ci rédige une réponse sourcée. Notre guide du RAG en entreprise détaille son fonctionnement en quatre temps.
Combien coûte un RAG en 2026 ? La fourchette pour une PME
Un RAG coûte à une PME entre 5 000 et 50 000 € de mise en place, plus 200 à 3 000 € par mois de fonctionnement, selon la grille Koïno 2026 et les baromètres français. Un POC tient sous 8 000 €, un RAG multi-sources sur corpus réglementé approche 50 000 €. Trois variables font l'écart : la taille du corpus, la finesse des droits d'accès et le choix cloud ou souverain.
Les repères tiers convergent. Les baromètres français des budgets IA (La Fabrique du Net, Stema, Fenxi) situent un agent RAG sur mesure entre 10 000 et 50 000 € de construction, plus 1 000 à 3 000 € par mois, avec un cadrage préalable de 3 000 à 12 000 €. Le guide RAG de Tensoria chiffre un POC entre 3 000 et 10 000 €, un projet complet multi-sources entre 15 000 et 40 000 €, et un fonctionnement de 100 à 800 € par mois. Pour un chatbot sur 20 à 50 documents, Mission Open Data annonce 3 000 à 8 000 €, et 8 000 à 15 000 € au-delà de 100 documents. Le consultant Antoine Guerra place un chatbot RAG sur mesure entre 10 000 et 40 000 €. Enfin, Developr situe une version de production connectée à plusieurs sources entre 20 000 et 40 000 €.
Le prix d'entrée réel d'un RAG utile en PME se situe donc autour de 10 000 €, rarement en dessous de 5 000 € une fois le run compté. Pour replacer ce montant dans un budget IA global, notre guide des prix d'un projet IA en 2026 détaille chaque poste, et notre grille de prix d'un agent IA par cas d'usage compare le RAG aux autres livrables.
Prix d'un RAG par profil de projet : build, run mensuel et délai de mise en production.
| Profil de projet | Corpus et sources | Setup (build) | Run mensuel | Délai | Souveraineté |
|---|---|---|---|---|---|
| POC / test de valeur | Quelques dizaines de documents, 1 source | 3 000 à 8 000 € | 100 à 300 € | 2 à 4 semaines | Cloud |
| Chatbot documentaire simple (PME) | 20 à 50 documents, 1 source | 5 000 à 12 000 € | 200 à 500 € | 3 à 6 semaines | Cloud UE possible |
| RAG PME multi-sources | 100+ documents, 2 à 4 sources | 10 000 à 25 000 € | 500 à 1 200 € | 6 à 10 semaines | Cloud UE |
| RAG multi-équipes avec droits fins | Plusieurs services, permissions | 20 000 à 40 000 € | 1 000 à 2 000 € | 8 à 14 semaines | Cloud UE ou hybride |
| RAG métier réglementé (juridique, finance) | Corpus sensible, traçabilité | 25 000 à 50 000 € | 1 500 à 3 000 € | 10 à 16 semaines | Hébergement maîtrisé |
| RAG souverain on-premise | Données confidentielles | 40 000 € et plus | 2 000 à 5 000 € | 12 à 20 semaines | On-premise / SecNumCloud |
| ETI ou grand compte, SI complexe | Multi-sources plus ERP / CRM | 50 000 € et plus | Sur devis | 3 à 6 mois | Au choix |
| Plateforme SaaS prête à l'emploi | Abonnement (Dust, Copilot, NotebookLM) | Faible setup | 9 à 40 $/utilisateur (tarifs éditeurs) | Quelques jours | Variable selon l'éditeur |
Estimez le budget de votre RAG en 2 minutes. Indiquez la taille de votre corpus, le nombre de sources et votre niveau de confidentialité : notre calculateur de coût RAG renvoie une fourchette de build et de run calée sur votre contexte PME.
Qu'est-ce qui fait le prix d'un RAG (ou chatbot documentaire) ?
Le prix d'un RAG se répartit sur sept postes, dont trois seulement sont techniques. Comprendre cette répartition évite le piège classique : croire que le coût vient des tokens ou de la base vectorielle, alors qu'il vient surtout de la préparation des données et de la gestion des droits. Voici la décomposition que nous utilisons en chiffrage.
Les postes de coût d'un RAG et leurs fourchettes de prix, du cadrage au run.
| Poste de coût | Ce que ça couvre | Setup indicatif | Run mensuel indicatif | Ce qui fait varier |
|---|---|---|---|---|
| Cadrage et audit des sources | Périmètre, état des documents, cas d'usage | 3 000 à 12 000 € | Ponctuel | Nombre de sources, maturité documentaire |
| Préparation et ingestion | Nettoyage, découpage, réindexation | Inclus dans le build | Réindexation continue | Qualité et format des documents |
| Base vectorielle | Stockage et recherche sémantique | Configuration | 10 à 200 € | Volume de vecteurs, hébergement |
| LLM et tokens | Embeddings plus génération des réponses | Néant | 50 à 800 € | Volume de questions, modèle choisi |
| Intégration au SI | Connecteurs, poste de travail, interface | 5 000 à 20 000 € | Maintenance | Nombre et complexité des connecteurs |
| Gestion des droits et sécurité | Permissions miroir des sources, journalisation | 3 000 à 15 000 € | Supervision | Finesse des droits, sensibilité |
| Run (évaluation, supervision) | Jeux de tests, feedback, corrections | Amorçage | 500 à 2 500 € | Exigence de qualité, volume d'usage |
| Interface et UX | Chat web, intégration Teams / Slack | 2 000 à 10 000 € | Évolutions | Canaux, design, accessibilité |
Qu'est-ce qu'une base vectorielle et combien coûte-t-elle ?
Une base vectorielle est une base de données qui stocke vos documents sous forme de représentations numériques de leur sens, pour retrouver des passages par similarité d'idées et non par mots-clés exacts. C'est le poste que l'on surestime le plus. D'après le comparatif de prix des bases vectorielles de Spendark, une base gérée comme Pinecone démarre à environ 50 $ par mois et tourne autour de 70 $ à 10 millions de vecteurs. Qdrant Cloud entre autour de 10 $ par mois en tarif d'entrée et grimpe vers 65 $ à 10 millions de vecteurs, tandis que pgvector (extension de PostgreSQL) ne coûte que l'instance PostgreSQL, d'environ 50 $ par mois en entrée à près de 120 $ à cette même échelle. À l'échelle d'une PME, dont le corpus reste très loin des 10 millions de vecteurs, la base vectorielle pèse quelques dizaines d'euros par mois, pas des milliers.
Prix d'un chatbot sur mes documents : ce que vous payez au setup, ce que vous payez chaque mois
Le prix d'un chatbot sur mes documents se lit en deux temps : un investissement de départ (le build) et une facture mensuelle (le run). Le build concentre le travail humain de cadrage, d'intégration et de gestion des droits. Le run mélange une part logicielle (tokens et base vectorielle) et une part humaine (supervision et évaluation), et c'est la seconde qui domine.
Côté tokens, les prix ont fondu. Selon EmbeddingCost, indexer vos documents avec les embeddings d'OpenAI coûte 0,02 $ par million de tokens pour text-embedding-3-small et 0,13 $ pour la version large. Pour la génération des réponses, le relevé de tarifs Mistral de CloudZero situe Mistral Small 4 à 0,15 $ en entrée et 0,60 $ en sortie par million de tokens, Mistral Large 3 à 0,50 / 1,50 $, et Mistral Embed à 0,10 $ par million. Chez Anthropic, d'après Finout, Claude Haiku 4.5 est à 1 / 5 $ et Sonnet à 3 / 15 $ par million de tokens, avec un cache qui ramène l'entrée à 10 % de son prix et une Batch API qui divise la facture par deux. Traduit en usage réel : un RAG PME qui traite quelques milliers de questions par mois dépense le plus souvent 50 à 500 € de tokens et de base vectorielle réunis.
Autrement dit, la brique logicielle d'un RAG est devenue marginale : le coût mensuel est d'abord celui des humains qui le supervisent et l'améliorent. C'est pourquoi un devis honnête budgète le run avant le lancement, pas après la première dérive de qualité. Le choix du modèle relève d'ailleurs autant de la souveraineté que du prix, un arbitrage détaillé dans notre comparatif Mistral, OpenAI et Anthropic pour les entreprises françaises.
Budget d'un RAG sur données internes : cloud ou souverain on-premise ?
Le budget d'un RAG sur données internes bascule dès que la confidentialité impose de garder les données dans votre réseau. En cloud via API, l'infrastructure ne coûte presque rien à l'échelle PME : vous payez à l'usage, sans serveur à gérer. En souverain on-premise, vous financez le matériel et son exploitation, quel que soit le volume.
Les chiffres cadrent l'écart. Selon l'analyse coût de DevTk.AI sur l'auto-hébergement, un serveur GPU A100 80 Go tourne autour de 1 440 $ par mois en location continue, auquel s'ajoutent 10 à 20 heures d'ingénierie mensuelles (750 à 3 000 $) pour la maintenance et la supervision. La même source recommande de multiplier le coût GPU brut par 1,3 à 2,0 pour obtenir le coût réel, et rappelle que l'auto-hébergement ne devient rentable face aux API qu'au-delà d'environ 8 millions de tokens par jour, un volume qu'une PME atteint rarement. Le souverain on-premise ne se justifie donc pas par le prix, mais par la contrainte : données de santé, finance, secteur public ou interprétation stricte du RGPD qui interdit l'envoi vers un fournisseur tiers.
SaaS clé en main, cloud, cloud UE ou souverain on-premise : comparatif coût, exploitation et RGPD.
| Critère | SaaS clé en main | Cloud (API managée) | Cloud UE dédié | Souverain on-premise |
|---|---|---|---|---|
| Coût d'entrée | ✓ Faible (abonnement) | ✓ Très faible (à l'usage) | ◐ Modéré | ✗ Élevé (matériel) |
| Coût à petite échelle | ✓ Bas à faible effectif | ✓ Le moins cher sur mesure | ◐ Correct | ✗ Le plus cher |
| Confidentialité des données | ◐ Selon l'éditeur | ◐ Dépend du contrat | ◐ Bonne (hébergement UE) | ✓ Données dans votre réseau |
| Effort d'exploitation | ✓ Nul (géré) | ✓ Minimal | ◐ Modéré | ✗ DevOps dédié |
| Délai de mise en production | ✓ Immédiat | ✓ Rapide | ◐ Moyen | ✗ Long |
| RGPD et données sensibles | ◐ À vérifier selon l'éditeur | ◐ À encadrer | ✓ Adapté | ✓ Maîtrise totale |
| Qualification SecNumCloud | ✗ Rare | ✗ Rare | ◐ Selon l'hébergeur | ✓ Possible |
| Idéal pour | Besoin simple, peu d'utilisateurs | PME, POC, volumes modérés | ETI, données RGPD standard | Secteurs régulés, secret |
Légende : ✓ avantage net, ◐ dépend du contexte, ✗ point faible. Un point de vocabulaire utile : Mistral, éditeur français, met en avant une résidence des données en Europe qui en fait, selon CloudZero, le fournisseur de premier plan le plus naturellement aligné sur le RGPD. Pour arbitrer entre coût et confidentialité sans se tromper, lisez notre guide de l'IA souveraine et de l'hébergement des données et modèles en Europe : un RAG on-premise coûte plus cher, mais il ne laisse jamais sortir vos documents.
Les coûts cachés d'un RAG : qualité documentaire, évaluation continue, run
Trois postes n'apparaissent presque jamais dans un devis initial, et ce sont eux qui font échouer les projets. Les ignorer, c'est signer un budget faux dès le départ. Nous les mettons systématiquement au chiffrage.
- La qualité documentaire. Un RAG n'assainit pas votre documentation, il l'expose. Comme le souligne Antoine Guerra, des documents propres et structurés coûtent beaucoup moins à indexer que des PDF mal formés ou des exports hérités. Le tri des sources n'est pas un préalable optionnel, c'est la moitié du projet.
- L'évaluation continue. Sans jeu de questions de référence rejoué régulièrement, la qualité des réponses dérive en silence au fil des ajouts et des changements de modèle. C'est une charge de run récurrente, pas une tâche de lancement.
- Le run et la maintenance. Un RAG n'est pas un projet qui se termine, c'est un service qui tourne : consommation des modèles, réindexation, supervision, connecteurs à maintenir.
Règle de TCO à retenir : multipliez le devis de build par environ 1,5 pour approcher le coût réel sur trois ans. Cette majoration cadre bien avec le facteur de 1,3 à 2,0 documenté par DevTk.AI sur l'auto-hébergement. Un RAG à 20 000 € de construction représente ainsi un budget de l'ordre de 30 000 € sur trois ans, run compris.
Le point Koïno
Le poste qui déraille le plus n'est ni la base vectorielle ni les tokens : c'est la gestion des droits sur des données sensibles. Pour une grande banque française, Koïno a conçu 6 agents IA génératifs combinant LLM et RAG sur les périmètres finance et assurance, avec plus de 10 projets validés par le COMEX. La même logique alimente la détection de fraude documentaire par IA, où le RAG croise un document soumis avec les référentiels internes. Autre preuve côté productivité : pour le cabinet M&A Adviso Partners, nos agents documentaires ont libéré plus de 120 heures par mois, et un RAG branché sur une base vivante alimente aussi la mise à jour automatique d'une base alumni par LLM. Notre méthode Sx4 part de l'audit de vos sources et livre sur un périmètre resserré avant d'élargir, parce que trop de projets IA s'enlisent avant d'atteindre la production.
« Sur nos chiffrages de RAG en PME, le poste qui fait exploser le budget n'est presque jamais la base vectorielle ni les tokens : c'est la remise en état documentaire et la réplication fine des droits d'accès. Un devis qui n'isole pas le run sur douze mois sous-estime le coût réel d'au moins un tiers. »
Maxence Morin, Co-fondateur Tech & Ops de Koïno, août 2026
Table des matières
{{text}}
FAQ - Questions fréquentes
Découvrez ici les réponses aux questions les plus courantes pour mieux comprendre notre expertise et notre accompagnement personnalisé chez Koïno AI.
Combien coûte un RAG ?
Un RAG (chatbot documentaire) coûte à une PME entre 5 000 et 50 000 € de mise en place, plus 200 à 3 000 € par mois de fonctionnement, selon la grille Koïno 2026 et les baromètres français (La Fabrique du Net, Stema, Fenxi). Un POC tient sous 8 000 €, un RAG multi-sources sur corpus réglementé approche 50 000 €. Comptez ensuite le run : c'est lui qui fait le coût réel sur trois ans.
Quel est le prix d'un chatbot sur mes documents ?
Le prix d'un chatbot sur mes documents se décompose en un build de 5 000 à 40 000 € et un run de 200 à 3 000 € par mois. Le build finance surtout le cadrage, l'intégration et la gestion des droits ; le run mêle tokens, base vectorielle (quelques dizaines d'euros) et supervision humaine, qui domine. Un chatbot sur 20 à 50 documents démarre autour de 5 000 à 8 000 € selon Mission Open Data.
Quel budget pour un RAG sur mes données internes ?
Le budget d'un RAG sur données internes dépend d'abord de la contrainte de confidentialité. En cloud via API, l'infrastructure coûte peu et le budget PME reste dans la fourchette 10 000 à 40 000 € de build. En souverain on-premise, il faut ajouter un serveur GPU (autour de 1 440 $ par mois pour un A100 selon DevTk.AI) et son exploitation. Le souverain se justifie par le RGPD ou le secret, pas par le prix.
Quel est le coût mensuel (run) d'un RAG ?
Le run d'un RAG PME va de 200 à 3 000 € par mois selon le volume d'usage et l'exigence de qualité. La part logicielle (tokens et base vectorielle) pèse souvent 50 à 500 €, le reste est humain : supervision, évaluation continue, réindexation et corrections. Sous-budgéter ce poste est la première cause d'un RAG qui se dégrade après le lancement.
SaaS (Dust, Copilot) ou RAG sur mesure : lequel coûte le moins cher ?
Une plateforme SaaS comme Dust, Microsoft Copilot ou NotebookLM démarre à faible coût, de l'ordre de 9 à 40 $ par utilisateur et par mois selon les grilles publiques des éditeurs, sans projet lourd. Un RAG sur mesure coûte plus au départ (10 000 € et plus) mais s'intègre finement à votre SI et à vos droits d'accès. En dessous de quelques dizaines d'utilisateurs et sur un besoin simple, le SaaS gagne ; sur un corpus sensible et multi-sources, le sur-mesure devient plus économique et plus sûr.




