Retour à l’Académie IA

Académie IA · RAG

Qu’est-ce que le RAG (Retrieval-Augmented Generation) ?

Le RAG permet à un modèle d’IA générative de rechercher des informations dans des sources externes avant de produire une réponse. Très utilisé pour exploiter les connaissances internes d’une entreprise, il permet notamment de travailler sur des volumes documentaires importants tout en améliorant la pertinence et la traçabilité des réponses.

Définition 30 sec

Le RAG, pour Retrieval-Augmented Generation — aussi traduit par génération augmentée par récupération —, est une approche qui combine recherche d’information et génération de contenu par un modèle de langage.

Lorsqu’un utilisateur pose une question, le système recherche d’abord les informations pertinentes dans les sources auxquelles il a accès. Il transmet ensuite ces informations au LLM afin qu’il puisse produire une réponse contextualisée.

Le RAG permet ainsi de connecter un modèle à des connaissances externes à son entraînement, notamment des données privées ou régulièrement mises à jour au sein d’une entreprise.

Comprendre

Un LLM génère ses réponses à partir de ce qu’il a appris pendant son entraînement et des informations qui lui sont fournies dans son contexte. Or, en entreprise, une grande partie des connaissances utiles est privée, évolue régulièrement et se trouve dispersée dans des documents, bases de connaissances ou applications métier.

Le RAG ajoute donc une étape essentielle avant la génération : retrouver l’information dont le modèle a réellement besoin pour répondre.

Cette distinction permet aussi d’éviter une confusion fréquente. Un RAG ne se résume pas à découper des documents en fragments, à les stocker dans une base vectorielle puis à effectuer une recherche sémantique. Cette architecture a largement contribué à populariser le RAG, mais elle n’en constitue qu’une implémentation.

Le principe est plus général : identifier et récupérer les informations pertinentes avant de les transmettre au modèle.

C’est également pour cette raison que RAG et contexte long ne doivent pas systématiquement être opposés. Pour analyser ponctuellement un document ou un corpus limité, fournir directement l’ensemble du contenu au modèle peut être la solution la plus simple. Mais lorsque les volumes augmentent, que les informations évoluent fréquemment ou que leur origine doit pouvoir être vérifiée, rechercher uniquement les éléments utiles devient beaucoup plus pertinent.

Comment ça fonctionne ?

Le fonctionnement d’un système RAG peut être résumé en quatre grandes étapes.

Préparer les connaissances

Les documents et autres sources accessibles au système sont préparés afin de pouvoir être interrogés efficacement. Selon l’architecture retenue, les contenus peuvent notamment être découpés en passages, enrichis de métadonnées et représentés sous forme d’embeddings.

Rechercher les informations pertinentes

Lorsqu’une requête arrive, le système identifie les informations susceptibles d’y répondre. Cette recherche peut être sémantique, lexicale ou hybride. Les approches hybrides combinent notamment la capacité de la recherche sémantique à comprendre des formulations en langage naturel avec celle de la recherche lexicale à retrouver précisément des références, noms de produits, codes internes ou termes spécifiques.

Sélectionner et construire le contexte

Les résultats sont sélectionnés et peuvent être réordonnés selon leur pertinence, notamment grâce à des mécanismes de reranking. Les informations retenues constituent alors le contexte transmis au modèle avec la demande de l’utilisateur.

Générer une réponse à partir du contexte

Le LLM utilise la question et les informations récupérées pour construire sa réponse. Lorsque l’usage l’exige, le système peut également conserver ou afficher les documents sources afin de permettre à l’utilisateur de vérifier l’origine des informations utilisées.

Dans des architectures plus avancées, ce processus n’est plus nécessairement linéaire. Un agent peut reformuler une requête, interroger plusieurs sources ou lancer une nouvelle recherche lorsqu’il estime que les informations récupérées sont insuffisantes. On parle alors notamment d’Agentic RAG.

Exemple concret

Dans un projet mené par aiko pour un acteur des médias, les équipes devaient pouvoir rechercher rapidement des informations au sein d’une base documentaire constituée de plusieurs milliers de contenus et continuellement mise à jour.

Transmettre l’intégralité de cette documentation au modèle pour chaque question aurait été à la fois coûteux et peu adapté aux temps de réponse attendus par les utilisateurs.

Une architecture RAG permet au contraire de rechercher, pour chaque requête, uniquement les contenus pertinents avant de les transmettre au modèle.

Dans un autre projet, l’enjeu était différent : chaque décision produite par le système devait pouvoir être justifiée. La qualité de la réponse ne suffisait donc pas. Il fallait également pouvoir identifier précisément les informations sur lesquelles elle reposait.

Ces deux situations illustrent deux raisons fréquentes d’utiliser un RAG en entreprise : accéder efficacement à de grands volumes de connaissances et conserver la traçabilité des informations utilisées par l’IA.

Pourquoi c’est important pour les entreprises ?

Une grande partie de la valeur potentielle de l’IA générative en entreprise dépend de sa capacité à travailler avec les connaissances propres à l’organisation : documentation, procédures, données produit, contrats, référentiels métiers ou historiques opérationnels.

Le RAG constitue l’une des principales architectures permettant de créer ce lien sans devoir intégrer ces connaissances dans l’entraînement du modèle.

Mais déployer un RAG ne garantit pas pour autant la qualité des réponses. Dans de nombreux projets, la qualité de l’accès à l’information devient aussi importante que celle du modèle lui-même.

Une recherche purement sémantique peut par exemple manquer une référence réglementaire ou un code produit précis. Une recherche uniquement fondée sur les mots-clés peut, à l’inverse, avoir du mal à interpréter une question formulée naturellement. La qualité des sources, leur actualisation, leur indexation, les droits d’accès, la stratégie de recherche, l’évaluation et la traçabilité deviennent alors des composants à part entière du système.

C’est aussi ce qui explique que le RAG tende à devenir moins visible. Il n’est plus nécessairement présenté comme un cas d’usage ou une innovation en soi : il devient une brique d’infrastructure des systèmes d’IA d’entreprise chargée de donner au modèle accès à la bonne information au bon moment.

Les architectures évoluent — contexte long, recherche hybride, agents, Agentic RAG — mais le besoin reste le même : permettre aux systèmes IA d’accéder à une information pertinente, fiable et vérifiable au moment où ils doivent agir ou répondre.