Le RAG expliqué : un chatbot qui répond uniquement à partir de vos documents
Un chatbot qui invente votre politique de remboursement est pire que pas de chatbot. Voici comment le RAG ancre les réponses dans vos vrais documents.
Interrogez un modèle généraliste sur vos conditions de garantie et il produira une réponse assurée, bien écrite et entièrement fictive. Il n'a jamais vu vos documents. La génération augmentée par récupération — RAG — corrige cela en récupérant d'abord les passages pertinents de votre propre contenu, puis en demandant au modèle de répondre uniquement à partir de ces passages.
Ce seul changement d'architecture sépare l'outil interne auquel votre équipe fait confiance de la démo qu'on désactive discrètement après la première réponse embarrassante.
Comment ça marche, en quatre étapes
- Ingestion : vos documents — contrats, politiques, spécifications produit, tickets de support, propositions passées — sont découpés en passages de quelques centaines de mots.
- Indexation : chaque passage est converti en un vecteur qui encode son sens, puis stocké dans un index consultable avec ses métadonnées de source.
- Récupération : la question entrante est convertie de la même façon, et les passages les plus proches sont ramenés, généralement combinés à une recherche par mots-clés pour capter les termes exacts comme les références produit.
- Génération : le modèle reçoit la question et ces passages, avec l'instruction de répondre uniquement à partir d'eux et de citer la source.
Où ces projets échouent réellement
Des documents sources en désordre
PDF scannés sans couche texte, cinq versions de la même politique sans indication de la version en vigueur, tableaux qui perdent tout sens une fois aplatis en texte. Le nettoyage et la structuration du corpus représentent typiquement soixante pour cent du travail, et les sauter garantit un système qui cite avec assurance un document remplacé en 2023.
Un découpage naïf
Couper tous les 500 caractères tranche les phrases en deux et sépare l'en-tête d'un tableau de ses lignes. Découpez sur la structure — sections, titres, unités logiques — et gardez assez de recouvrement pour que le contexte survive à la frontière.
Aucun chemin de refus
Si la récupération ne renvoie rien de pertinent, le comportement correct est de le dire et de proposer un contact humain. Un système autorisé à se rabattre sur ses connaissances générales finira par donner à votre client un conseil à consonance juridique que vous n'avez jamais écrit, dans la voix de votre marque.
Mesurer si ça fonctionne
Constituez un jeu d'évaluation avant de construire le système : cinquante vraies questions, avec la bonne réponse et le document dont elle provient. Mesurez ensuite la précision de récupération — le bon passage est-il revenu — séparément de la qualité de réponse. Sans cette séparation, impossible de savoir si une mauvaise réponse vient de la récupération ou de la génération, et vous réglerez le mauvais composant.
- 90%+ précision de récupération visée sur votre jeu d'évaluation
- 0 réponse inventée hors corpus
- 100% réponses accompagnées d'une citation de source
Le coût de fonctionnement
Pour une PME, un assistant RAG interne bien conçu coûte typiquement quelques centaines d'euros par mois : les coûts d'embedding sont ponctuels par document, le stockage vectoriel est peu coûteux à cette échelle, et la génération est facturée à la question. Le coût dominant n'est pas l'infrastructure, c'est l'effort initial pour amener vos documents dans un état digne d'être indexé.
Garder l'index à jour
Un assistant RAG n'est à jour que de sa dernière ingestion, et une politique obsolète citée avec assurance fait plus de dégâts qu'une absence de réponse. Décidez dès le départ comment les documents entrent, et comment ils sortent.
- Réindexez au changement plutôt qu'à intervalle fixe, pour qu'un tarif modifié soit actif en quelques minutes et non en fin de mois.
- Supprimez pour de bon. Retirer un document d'un dossier doit retirer ses passages de l'index, sinon l'assistant continue de citer un contrat que vous avez résilié.
- Portez la date d'effet dans les métadonnées et affichez-la dans la réponse. On pardonne un document ancien dont on voit la date.
- Gardez une seule version canonique par sujet. Deux politiques contradictoires dans le corpus donnent un assistant qui en choisit une au hasard, ce qui est pire que les deux.
Les permissions, concrètement
Le contrôle d'accès doit s'appliquer à la récupération, pas après la génération. Si le modèle voit un passage qu'il ne devrait pas voir, filtrer la formulation ensuite ne sert à rien : la réponse porte quand même le contenu, et la citation pointe vers le document. Attachez l'audience à chaque passage lors de l'ingestion, transmettez les groupes de la personne avec la question, et laissez l'index ne renvoyer que ce qu'elle pouvait déjà ouvrir. Un assistant qui répond aux questions RH à toute l'entreprise est un incident de données en attente d'une capture d'écran.
Quand le RAG est le mauvais outil
- Les questions portant sur des chiffres en base. Combien de commandes ont été livrées en retard le mois dernier est une requête, pas une recherche documentaire. Branchez l'assistant sur les données via une vraie couche de requête.
- Les statuts en temps réel. Suivi de commande, niveaux de stock et tickets ouverts changent d'heure en heure : appelez le système qui les détient plutôt que d'indexer la copie d'hier.
- Les calculs. Faire raisonner le modèle sur les montants récupérés est un pari ; calculez en code et laissez l'assistant présenter le résultat.
- Un corpus de cinq documents. Si une personne trouve la réponse avec un champ de recherche en dix secondes, livrez le champ de recherche.
La plupart des assistants que nous construisons finissent hybrides : de la récupération pour tout ce qui est écrit, quelques outils pour tout ce qui est stocké en données, et un refus clair quand ni l'un ni l'autre ne s'applique.
Un assistant ancré qui répond à quatre-vingts pour cent des questions avec citations vaut mieux qu'un assistant non ancré qui répond à cent pour cent, car le second vous oblige de toute façon à vérifier chaque réponse.
Questions fréquentes
Le RAG vaut-il mieux que le fine-tuning ?
Pour la connaissance factuelle d'entreprise, presque toujours. Le fine-tuning enseigne un style et un format ; la récupération fournit les faits. Mettre à jour un système RAG consiste à ajouter un document, alors que mettre à jour un modèle fine-tuné suppose de le réentraîner — et aucune des deux approches ne fait réciter fidèlement à un modèle des détails qu'on lui a seulement fait apprendre.
Combien de documents faut-il pour que le RAG soit utile ?
La valeur apparaît quand la recherche cesse d'être triviale, généralement au-delà de quelques dizaines de documents substantiels. En dessous, un espace partagé bien organisé est réellement la meilleure réponse, et nous vous le dirons.
Un assistant RAG peut-il divulguer des informations confidentielles ?
Oui, si les permissions ne sont pas appliquées au moment de la récupération. Le contrôle d'accès doit filtrer l'index par utilisateur avant la génération, pas après, dans le prompt. Un modèle à qui l'on demande de cacher une information qu'on lui a déjà montrée n'est pas une frontière de sécurité.
Combien de temps prend un projet RAG ?
Un assistant interne bien cadré sur un corpus propre demande généralement quatre à huit semaines, et la répartition surprend : deux semaines d'ingénierie, le reste sur les documents, les permissions et le jeu d'évaluation. Si la matière est faite de PDF scannés et de brouillons contradictoires, le travail documentaire domine le calendrier. Cet effort n'est pas perdu : un corpus digne d'être indexé est aussi un corpus que votre équipe peut enfin fouiller.
Faut-il l'ouvrir aux clients ou d'abord aux équipes ?
Commencez en interne, presque toujours. Vos équipes tolèrent une réponse imparfaite, vous signalent les erreurs et vous fournissent les questions qui manquaient au jeu d'évaluation. Après quelques semaines, vous disposez de vrais chiffres de précision et d'un chemin de refus éprouvé par des gens qui ne peuvent pas laisser un avis négatif. Ouvrez aux clients quand la précision de récupération est stable et que le passage à un humain est réellement rapide.
À lire ensuite
Vous voulez la même chose pour votre entreprise ? Voir ce que nous faisons.