RAG (retrieval-augmented generation) : la brique technique derrière un agent qui répond juste
Interrogez un assistant IA et il répond avec ce qu’il a mémorisé pendant son entraînement — jusqu’au jour où il invente une réponse plausible mais fausse. Le retrieval-augmented generation (RAG) est l’architecture conçue pour corriger ça : chercher avant de générer. Ce que c’est, et ce qu’il faut vérifier avant d’y faire tourner un agent.
Un modèle généraliste comme ChatGPT ou Claude répond à partir de deux sources : ce qu’il a appris pendant son entraînement, et ce qu’on lui donne dans la conversation en cours. Ni l’un ni l’autre n’est votre grille tarifaire actuelle, votre politique de congés ou l’avenant contractuel signé la semaine dernière — un assistant laissé à sa seule mémoire finira donc, tôt ou tard, par inventer une réponse plausible mais fausse. Ce n’est pas un problème de qualité de modèle qu’un modèle plus gros résout tout seul : c’est structurel, et l’architecture conçue pour y répondre a un nom, le retrieval-augmented generation (RAG).
Chercher avant de générer
Le mécanisme est plus simple que l’acronyme ne le laisse penser. Une question est convertie en représentation numérique et comparée à un index des documents propres à l’entreprise ; les passages les plus proches sont extraits et transmis au modèle en même temps que la question, de sorte que la réponse est générée à partir de cette matière retrouvée plutôt que de la seule mémoire du modèle. L’approche a été formalisée dans un article de 2020, Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks, par une équipe de Facebook AI Research dirigée par Patrick Lewis et présentée à NeurIPS — l’article qui a donné son nom à la technique et son architecture en deux temps, désormais standard.
Ce que ça change pour une entreprise qui déploie un assistant
Le gain concret n’est pas que le modèle devient plus intelligent — c’est que sa réponse s’ancre désormais dans un document précis et vérifiable plutôt que dans une moyenne statistique de ses données d’entraînement. Mettez à jour le document source et la prochaine réponse de l’assistant en tient compte immédiatement, sans réentraînement. Le revers : la qualité de la recherche fixe un plafond à la qualité de la réponse — un assistant qui répond avec assurance à partir du mauvais passage reste faux, juste plus poli en le disant.
- →Le découpage (chunking) : des documents fractionnés trop grossièrement ou trop finement rendent le bon passage difficile à retrouver — le découpage doit suivre la logique du document (une clause de politique, un article de contrat), pas un nombre fixe de caractères.
- →La fraîcheur : un assistant RAG vaut ce que vaut son index — tout ce qui est sensible au temps (tarifs, politique de congés, conditions du mois) demande un calendrier de réindexation défini, pas un import ponctuel.
- →La traçabilité : une réponse sans source visible reste une boîte noire même quand elle est juste — exigez que l’agent montre le document dont il s’est servi, pour qu’une personne puisse vérifier en un clic avant d’agir dessus.
Rien de tout cela ne dispense d’une relecture humaine avant de mettre en production un assistant RAG sur des sujets sensibles. Ce que ça change, c’est le mode d’échec : au lieu d’une réponse inventée avec assurance et sans trace de son origine, on obtient une réponse vérifiable — parfois fausse, mais fausse d’une façon qu’on peut repérer.
Questions fréquentes
Le RAG élimine-t-il totalement les hallucinations ?+
Non. Il réduit les faits inventés en ancrant la réponse dans des passages retrouvés, mais une recherche fausse ou obsolète produit encore une réponse fausse avec assurance — d’où l’importance de la citation de source et d’une réindexation régulière, au même titre que le mécanisme de recherche lui-même.
Faut-il entraîner un modèle sur mesure pour faire du RAG ?+
Non — c’est justement l’intérêt de l’architecture. Le RAG fonctionne avec un modèle généraliste existant comme Claude et ajoute une étape de recherche en amont ; aucun fine-tuning ni réentraînement n’est nécessaire pour y brancher vos propres documents.
Ressource gratuite
La grille d’auto-diagnostic : 20 tâches automatisables par l’IA
Commercial, administratif, support, opérations : les 20 tâches que des agents IA prennent déjà en charge en PME — avec, pour chacune, le signal qui montre que vos équipes sont concernées.
À lire ensuite
Agents IA & automatisation
Claude Code passe en mode automatique par défaut : la leçon pour la supervision de vos propres agents IA
10 août 2026·5 min de lecture
Agents IA & automatisation
OpenAI Presence : même OpenAI ne vend plus ses agents IA en libre-service — ce que ça change pour votre PME
1 août 2026·5 min de lecture
Agents IA & automatisation
Perplexity Personal Computer arrive sur Windows : ce qu’un agent IA qui touche vos fichiers change pour votre PME
30 juillet 2026·5 min de lecture