GraphRAG : comment relier un graphe de connaissances à un LLM ?
GraphRAG désigne une famille d’architectures combinant :
- des documents ;
- des entités ;
- des relations ;
- un graphe de connaissances ;
- un système de recherche ;
- un modèle de langage.
Un RAG classique retrouve principalement des fragments de documents proches de la question.
GraphRAG cherche également à représenter la structure du corpus :
- quelles personnes sont mentionnées ;
- quelles organisations sont reliées ;
- quels événements se succèdent ;
- quels concepts appartiennent au même ensemble ;
- quelles relations traversent plusieurs documents.
GraphRAG ajoute une mémoire relationnelle au processus de recherche documentaire.
Cette approche devient utile lorsque la réponse ne se trouve pas dans un seul passage, mais exige de relier plusieurs informations.
Ce que vous allez comprendre
À la fin de cet article, vous saurez :
- définir GraphRAG ;
- distinguer RAG classique et GraphRAG ;
- comprendre les étapes de construction d’un graphe ;
- identifier les différentes stratégies de recherche ;
- comprendre les notions de communautés et de résumés globaux ;
- connaître les principaux cas d’usage ;
- identifier les coûts, limites et risques ;
- déterminer quand GraphRAG apporte réellement de la valeur.
Rappel : fonctionnement d’un RAG classique
Un système RAG classique suit généralement ce processus :
Documents
↓
Découpage en fragments
↓
Création des embeddings
↓
Index vectoriel
↓
Question utilisateur
↓
Recherche de fragments proches
↓
LLM
↓
Réponse
Cette approche est efficace lorsque la réponse se trouve dans quelques passages clairement identifiables.
Exemple simple
Question :
Quelle est la durée de la formation SEO avancée ?
Un fragment contient :
La formation SEO avancée dure 21 heures.
Le RAG retrouve ce fragment et produit la réponse.
GraphRAG n’est pas nécessaire dans ce cas.
Limite du RAG classique
Prenons une question plus complexe :
Quelles entreprises sont indirectement reliées au projet Alpha par leurs collaborateurs, partenaires et contrats ?
La réponse peut être répartie dans :
- plusieurs contrats ;
- des comptes rendus ;
- des annuaires ;
- des présentations ;
- des courriels.
Une recherche vectorielle peut retrouver certains passages, mais manquer la structure globale.
Principe de GraphRAG
GraphRAG construit une représentation relationnelle à partir des sources.
Documents
↓
Extraction des entités
↓
Extraction des relations
↓
Résolution des identités
↓
Construction du graphe
↓
Détection de groupes
↓
Création de résumés
↓
Recherche graphe + documents
↓
Réponse du LLM
Le graphe sert de couche intermédiaire entre le corpus et le modèle.
Les entités
Les entités peuvent être :
- des personnes ;
- des organisations ;
- des produits ;
- des lieux ;
- des événements ;
- des documents ;
- des lois ;
- des concepts ;
- des compétences ;
- des incidents.
Exemple :
Marie Dupont
Entreprise Alpha
Projet Orion
Toulouse
Contrat 458
Les relations
Les relations peuvent être :
Marie Dupont → travaille pour → Entreprise Alpha
Entreprise Alpha → participe à → Projet Orion
Projet Orion → est régi par → Contrat 458
Contrat 458 → concerne → Client Beta
Ces relations permettent de suivre des chemins entre plusieurs sources.
Les propriétés
Les entités et relations peuvent contenir :
- une date ;
- une source ;
- une version ;
- un statut ;
- un niveau de confiance ;
- une description ;
- un type.
Exemple :
Marie Dupont → travaille pour → Entreprise Alpha
date_début : 2023-01-01
source : annuaire interne
confiance : élevée
Construction du graphe
1. Collecter les sources
Le corpus peut contenir :
- rapports ;
- contrats ;
- pages web ;
- courriels ;
- notes ;
- bases de données ;
- procédures ;
- transcriptions.
2. Nettoyer les documents
Il faut notamment :
- supprimer les doublons ;
- identifier les versions ;
- corriger les erreurs d’extraction ;
- conserver les titres ;
- ajouter les métadonnées ;
- séparer les contenus non pertinents.
3. Découper les textes
Les documents sont divisés en unités exploitables.
Le découpage doit préserver les relations importantes.
Exemple :
Un nom peut apparaître dans un paragraphe et sa fonction dans le suivant.
Un découpage trop agressif peut séparer ces informations.
4. Extraire les entités
Un modèle ou un système de règles identifie :
Personne : Marie Dupont
Organisation : Entreprise Alpha
Projet : Projet Orion
Ville : Toulouse
5. Extraire les relations
Le système propose :
Marie Dupont → travaille pour → Entreprise Alpha
Entreprise Alpha → gère → Projet Orion
Projet Orion → est situé à → Toulouse
6. Résoudre les identités
Le corpus peut contenir :
Entreprise Alpha
Alpha SAS
Alpha
Société Alpha
Il faut déterminer s’il s’agit de la même entité.
Cette phase est essentielle.
Une mauvaise fusion crée de fausses connexions.
Une absence de fusion crée des doublons.
7. Ajouter les sources
Chaque relation doit être rattachée à son passage d’origine.
Relation :
Entreprise Alpha → gère → Projet Orion
Source :
Rapport annuel 2026, page 12.
8. Valider
Les entités et relations peuvent être :
- validées automatiquement ;
- contrôlées par des règles ;
- vérifiées par un expert ;
- marquées comme hypothétiques.
Graphe local et graphe global
GraphRAG peut répondre à deux types de questions.
Questions locales
Elles portent sur une entité précise.
Exemples :
- pour quelle entreprise travaille Marie ?
- quels documents mentionnent le projet Orion ?
- quels incidents concernent le produit X200 ?
- quelles formations développent la compétence SEO ?
Le système explore le voisinage de l’entité.
Questions globales
Elles portent sur l’ensemble du corpus.
Exemples :
- quels sont les principaux thèmes de ces rapports ?
- quelles communautés d’acteurs apparaissent ?
- quelles évolutions générales se dégagent ?
- quels groupes de risques sont les plus fréquents ?
Une simple recherche de fragments peut être insuffisante.
GraphRAG peut construire des résumés à différents niveaux.
Les communautés du graphe
Une communauté est un groupe d’entités fortement reliées.
Exemple :
Communauté 1
- Projet Orion
- Entreprise Alpha
- Marie Dupont
- Contrat 458
Communauté 2
- Produit X200
- Support réseau
- Incident 784
- Fournisseur Gamma
La détection de communautés aide à identifier la structure globale du corpus.
Les résumés de communautés
Le système peut générer un résumé pour chaque groupe.
Exemple :
La communauté Orion rassemble le projet, son entreprise responsable, ses collaborateurs principaux et les contrats associés.
Ces résumés peuvent être utilisés pour répondre à des questions globales.
Recherche locale
Une recherche locale peut partir d’une entité.
Question :
Quels projets sont reliés à Marie Dupont ?
Le système explore :
Marie Dupont
→ travaille pour → Entreprise Alpha
→ participe à → Projet Orion
→ mentionnée dans → Rapport 2026
Il récupère ensuite les passages documentaires correspondants.
Recherche globale
Question :
Quels sont les principaux enjeux mentionnés dans les rapports du projet ?
Le système peut :
- identifier les communautés ;
- consulter leurs résumés ;
- comparer les thèmes ;
- produire une synthèse globale.
Recherche hybride
Une recherche hybride combine :
- recherche vectorielle ;
- mots-clés ;
- filtres ;
- graphe ;
- résumés ;
- règles métier.
Cette approche est souvent plus robuste qu’une seule méthode.
Exemple : corpus d’entreprise
Une entreprise possède :
- contrats ;
- comptes rendus ;
- fiches projets ;
- annuaires ;
- rapports ;
- procédures.
Question simple
Quel est le responsable du projet Orion ?
Une recherche documentaire peut suffire.
Question relationnelle
Quelles personnes liées au projet Orion travaillent également sur des contrats concernant le client Beta ?
Le graphe doit suivre :
Personne
→ participe à → Projet Orion
→ travaille sur → Contrat
→ concerne → Client Beta
Question globale
Quels groupes d’acteurs structurent l’ensemble des projets de l’entreprise ?
La détection de communautés devient pertinente.
Exemple : recherche scientifique
Un corpus contient :
- articles ;
- auteurs ;
- méthodes ;
- résultats ;
- institutions ;
- jeux de données.
Le graphe peut représenter :
Auteur → écrit → Article
Article → utilise → Méthode
Article → analyse → Jeu de données
Auteur → appartient à → Institution
GraphRAG peut répondre à :
- quelles équipes utilisent les mêmes méthodes ?
- quels travaux reposent sur le même jeu de données ?
- quelles communautés scientifiques apparaissent ?
- quelles méthodes sont associées à certains résultats ?
Exemple : conformité
Le graphe peut relier :
Obligation → s’applique à → Activité
Activité → réalisée par → Service
Service → produit → Document
Document → satisfait → Contrôle
Question :
Quels services sont concernés par les obligations non encore couvertes par un document valide ?
Cette question nécessite plusieurs relations.
GraphRAG et ontologie
Une ontologie définit :
- les types d’entités ;
- les relations autorisées ;
- les contraintes ;
- le vocabulaire.
Sans modèle, un système peut produire des relations incohérentes :
Toulouse → travaille pour → Marie
L’ontologie peut imposer :
Personne → travaille pour → Organisation
Elle améliore donc la qualité du graphe.
GraphRAG et base de connaissances
GraphRAG peut être une composante d’une base de connaissances.
La base peut contenir :
- documents ;
- graphe ;
- règles ;
- métadonnées ;
- index vectoriel ;
- sources ;
- historique.
GraphRAG et règles métier
Le graphe décrit les relations.
Les règles peuvent produire des conclusions.
Exemple :
Produit X200 → couvert par → Contrat Alpha
Contrat Alpha → statut → Expiré
Règle :
SI le contrat est expiré
ALORS la garantie standard ne s’applique pas.
Le moteur symbolique garantit une application plus stable que le LLM seul.
GraphRAG et LLM
Le LLM peut intervenir à plusieurs étapes.
Extraction
Il propose les entités et relations.
Normalisation
Il rapproche les variantes lexicales.
Résumé
Il résume les communautés ou chemins du graphe.
Traduction de requêtes
Il transforme une question en requête structurée.
Génération
Il rédige la réponse finale.
Explication
Il présente les chemins utilisés.
Le LLM ne doit cependant pas être le seul garant de la vérité du graphe.
Limites de GraphRAG
Coût de construction
Extraire et valider les relations demande du temps et des ressources.
Complexité
Le système contient davantage de composants qu’un RAG simple.
Erreurs d’extraction
Une relation incorrecte peut contaminer les réponses.
Résolution d’entités difficile
Les homonymes et variantes créent des erreurs.
Mise à jour
Le graphe doit évoluer avec les documents.
Explosion du volume
Un corpus important peut produire des millions de nœuds et relations.
Résumés imparfaits
Un résumé de communauté peut perdre des nuances.
Fausses relations
Deux entités mentionnées dans le même passage ne sont pas nécessairement reliées.
Coût des requêtes
Une exploration complexe du graphe peut être lente.
Quand GraphRAG est-il pertinent ?
GraphRAG apporte de la valeur lorsque :
- les relations sont centrales ;
- la réponse traverse plusieurs documents ;
- les entités sont récurrentes ;
- le corpus possède une structure complexe ;
- les questions globales sont importantes ;
- les chemins de justification doivent être visibles.
Quand GraphRAG est-il inutilement complexe ?
Il peut être excessif lorsque :
- le corpus est petit ;
- les réponses se trouvent dans un passage unique ;
- les documents sont déjà bien structurés ;
- les relations ne sont pas utiles ;
- un filtre et une recherche vectorielle suffisent.
Critères de décision
| Question | Si oui |
|---|---|
| La réponse nécessite-t-elle plusieurs documents ? | GraphRAG peut aider |
| Les entités reviennent-elles souvent ? | Le graphe devient pertinent |
| Les relations doivent-elles être expliquées ? | Le graphe apporte de la traçabilité |
| Les questions portent-elles sur l’ensemble du corpus ? | Les communautés peuvent être utiles |
| Les documents sont-ils simples et indépendants ? | Un RAG classique peut suffire |
| Le budget de maintenance est-il limité ? | Commencer plus simplement |
Évaluer GraphRAG
Qualité des entités
Les personnes, organisations et concepts sont-ils correctement identifiés ?
Qualité des relations
Les relations sont-elles exactes ?
Résolution des identités
Les doublons et homonymes sont-ils correctement traités ?
Couverture
Le graphe contient-il les informations nécessaires ?
Provenance
Chaque relation est-elle reliée à une source ?
Qualité de la recherche
Le bon sous-graphe est-il récupéré ?
Qualité de la réponse
La réponse est-elle exacte et fidèle aux sources ?
Explication
Le système peut-il montrer le chemin suivi ?
Tests nécessaires
Test d’homonymie
Deux personnes portent le même nom.
Test de version
Une relation ancienne a été remplacée.
Test de contradiction
Deux documents divergent.
Test de chemin long
La réponse nécessite plusieurs relations.
Test de question globale
La réponse concerne plusieurs communautés.
Test d’absence
Le graphe ne contient pas suffisamment d’informations.
Sécurité
Les droits d’accès doivent s’appliquer :
- aux documents ;
- aux nœuds ;
- aux relations ;
- aux résumés ;
- aux réponses.
Une relation entre deux entités peut révéler une information confidentielle, même si chaque entité est publique séparément.
Méthode minimale pour commencer
Étape 1
Choisir une question relationnelle précise.
Étape 2
Définir trois à cinq types d’entités.
Étape 3
Définir quelques relations utiles.
Étape 4
Extraire un petit corpus.
Étape 5
Valider manuellement un échantillon.
Étape 6
Tester les questions réelles.
Étape 7
Comparer les résultats avec un RAG simple.
Étape 8
Étendre uniquement si le graphe apporte une amélioration mesurable.
Erreurs fréquentes
Construire un graphe sans cas d’usage
Le résultat devient volumineux mais inutilisable.
Extraire toutes les relations possibles
La majorité ne sera pas utile.
Ne pas définir d’ontologie
Les types et relations deviennent incohérents.
Fusionner automatiquement les entités
Les homonymes peuvent être confondus.
Ne pas conserver les passages sources
Les réponses deviennent difficiles à vérifier.
Utiliser GraphRAG pour une question simple
Le coût n’est pas justifié.
Ne pas comparer avec un RAG classique
Il devient impossible de mesurer la valeur ajoutée.
Considérer les résumés comme des sources primaires
Un résumé peut omettre des détails importants.
À retenir
- GraphRAG combine documents, graphe et modèle de langage.
- Un RAG classique retrouve principalement des fragments.
- GraphRAG représente aussi les entités et leurs relations.
- Les triplets forment la structure du graphe.
- La résolution d’entités est essentielle.
- Les communautés aident à comprendre la structure globale du corpus.
- Les recherches locales partent d’une entité précise.
- Les recherches globales utilisent souvent des résumés de groupes.
- Une ontologie améliore la cohérence du graphe.
- GraphRAG est utile lorsque les réponses traversent plusieurs documents.
- Il ajoute des coûts de construction et de maintenance.
- Sa valeur doit être comparée à celle d’un RAG plus simple.
Vérifiez votre compréhension
Quelle différence existe-t-il entre RAG et GraphRAG ?
Le RAG retrouve principalement des fragments de documents. GraphRAG représente également les entités et leurs relations.
Qu’est-ce qu’une communauté dans un graphe ?
Un groupe d’entités fortement reliées entre elles.
Pourquoi résoudre les identités ?
Pour éviter les doublons et la fusion incorrecte d’entités différentes.
À quoi sert l’ontologie ?
Elle définit les types d’entités, les relations et les contraintes.
Quand GraphRAG apporte-t-il le plus de valeur ?
Lorsque la réponse nécessite plusieurs documents, des relations indirectes ou une vue globale du corpus.
Pourquoi conserver les sources ?
Pour vérifier les relations et justifier les réponses.
Questions fréquentes
GraphRAG remplace-t-il le RAG classique ?
Non. Il peut le compléter.
Faut-il toujours construire un graphe complet ?
Non. Un graphe ciblé sur les relations utiles suffit souvent.
Un LLM peut-il créer automatiquement le graphe ?
Il peut proposer les entités et relations, mais une validation est nécessaire.
GraphRAG est-il adapté aux petits corpus ?
Parfois, mais un RAG simple est souvent suffisant.
Peut-on utiliser une base de données graphe ?
Oui. Elle peut stocker les nœuds, relations et propriétés.
GraphRAG garantit-il des réponses exactes ?
Non. La qualité dépend du corpus, de l’extraction, du graphe, de la recherche et de la génération.
Continuer le parcours
Étape précédente
Knowledge Engineering, RAG et LLM
Étape suivante
La prochaine étape consiste à organiser l’ensemble de ces concepts dans une méthode complète de projet.
➡️ Méthode d’ingénierie des connaissances : les étapes d’un projet