RAG (Retrieval-Augmented Generation)
Le RAG (Retrieval-Augmented Generation) permet à un modèle de langage de générer une réponse en s'appuyant sur des documents récupérés au moment de la question (documentation interne, base de connaissance, catalogue produit), plutôt que sur ses seules connaissances générales apprises à l'entraînement. La question sert à rechercher les passages pertinents, transmis ensuite au modèle comme contexte de réponse.
C'est la technique à utiliser dès qu'un assistant IA doit répondre avec des informations propres à une entreprise et régulièrement mises à jour : conditions tarifaires, procédures internes, fiches produit. Un support client interne, par exemple, peut ainsi répondre avec le contenu réel de la documentation technique, actualisé chaque semaine, sans jamais réentraîner de modèle. C'est l'un des projets les plus demandés en IA générative en entreprise.
La qualité du RAG dépend presque entièrement de la qualité de la recherche documentaire en amont, pas du modèle de langage choisi. Une base documentaire mal découpée en passages, ou une recherche qui ne remonte pas les bons extraits, produit des réponses fausses malgré un modèle performant. Le découpage et l'indexation des documents méritent donc autant d'attention que le choix du modèle.
