Graphe de connaissances : comment relier les informations d’un domaine ?
Un graphe de connaissances représente des entités et les relations qui les unissent.
Les personnes, les entreprises, les produits, les lieux, les documents, les événements ou les concepts sont représentés sous forme de nœuds. Les liens entre ces éléments sont représentés sous forme de relations.
Exemple :
Marie → travaille pour → Entreprise Alpha
Entreprise Alpha → est située à → Toulouse
Marie → possède → Compétence SEO
Compétence SEO → appartient à → Marketing numérique
Cette structure permet au système de parcourir les relations, de réunir des informations provenant de plusieurs sources et de répondre à des questions qui dépassent la simple recherche par mots-clés.
Un graphe de connaissances transforme une collection d’informations isolées en un réseau d’entités reliées et interprétables.
Ce que vous allez comprendre
À la fin de cet article, vous saurez :
- définir un graphe de connaissances ;
- comprendre les notions de nœud, relation et triplet ;
- distinguer graphe de connaissances, base graphe et ontologie ;
- comprendre comment construire un graphe ;
- identifier les problèmes de qualité et d’identité ;
- comprendre le rôle des sources, des dates et des niveaux de confiance ;
- relier les graphes aux LLM, au RAG et à GraphRAG.
Qu’est-ce qu’un graphe de connaissances ?
Un graphe de connaissances est une structure qui représente :
- des entités ;
- des concepts ;
- des propriétés ;
- des relations ;
- des événements ;
- des sources ;
- parfois des règles et des contraintes.
Il utilise généralement une représentation de type :
Sujet → relation → objet
Cette structure est parfois appelée triplet.
Exemple :
Marie → travaille pour → Entreprise Alpha
Le sujet est :
Marie
La relation est :
travaille pour
L’objet est :
Entreprise Alpha
Un ensemble de triplets forme progressivement un réseau de connaissances.
Exemple simple
Marie → travaille pour → Entreprise Alpha
Entreprise Alpha → est située à → Toulouse
Marie → possède → Compétence SEO
Compétence SEO → est requise par → Formation SEO avancé
Formation SEO avancé → est animée par → Paul
Ce graphe permet de répondre à plusieurs questions :
- pour quelle entreprise Marie travaille-t-elle ?
- dans quelle ville cette entreprise est-elle située ?
- quelle compétence Marie possède-t-elle ?
- quelle formation exige cette compétence ?
- qui anime cette formation ?
La réponse ne se trouve pas nécessairement dans un seul document. Elle peut être reconstruite en parcourant plusieurs relations.
Les composants d’un graphe de connaissances
Les nœuds
Un nœud représente généralement une entité ou un concept.
Exemples :
- Marie ;
- Entreprise Alpha ;
- Toulouse ;
- Formation SEO ;
- Compétence SEO ;
- Incident 458 ;
- Routeur X200.
Un nœud doit posséder une identité suffisamment claire.
Les relations
Une relation relie deux nœuds.
Exemples :
travaille pour
est situé à
possède
développe
concerne
est compatible avec
Une relation doit être plus précise que :
est lié à
Une relation vague apporte peu de valeur.
Les propriétés
Les nœuds et les relations peuvent posséder des propriétés.
Exemple :
Entreprise Alpha
├── nom : Entreprise Alpha
├── secteur : Formation
├── ville : Toulouse
└── année de création : 2012
Une relation peut également avoir des propriétés :
Marie → travaille pour → Entreprise Alpha
├── date de début : 2022
├── fonction : Responsable marketing
└── statut : Actif
Ces propriétés permettent de représenter davantage de contexte.
Les types
Les entités peuvent être associées à des types.
Marie
└── type → Personne
Entreprise Alpha
└── type → Organisation
Toulouse
└── type → Ville
Formation SEO
└── type → Formation
Les types peuvent être définis dans une ontologie informatique.
Le rôle de l’ontologie
L’ontologie définit généralement :
- les classes autorisées ;
- les types de relations ;
- les propriétés ;
- les contraintes ;
- les significations.
Le graphe contient les entités concrètes.
Ontologie
Une personne travaille pour une organisation.
Une organisation est située dans un lieu.
Une formation développe une compétence.
Graphe
Marie → travaille pour → Entreprise Alpha
Entreprise Alpha → est située à → Toulouse
Formation SEO → développe → Compétence SEO
L’ontologie décrit le modèle.
Le graphe décrit les faits.
Graphe de connaissances et base de données graphe
Ces deux notions sont proches, mais différentes.
Base de données graphe
Une base de données graphe est une technologie permettant de stocker et interroger des données sous forme de nœuds et de relations.
Elle peut contenir :
- un réseau social ;
- des transactions ;
- un réseau logistique ;
- des itinéraires ;
- des dépendances techniques.
Graphe de connaissances
Un graphe de connaissances ajoute généralement une dimension sémantique.
Il cherche à représenter :
- ce que les entités signifient ;
- leurs types ;
- leurs relations métier ;
- leur provenance ;
- leurs définitions ;
- leurs règles éventuelles.
Une base de données graphe est un outil technique.
Un graphe de connaissances est un modèle organisé du savoir.
Un graphe de connaissances peut être stocké dans une base de données graphe, mais les deux termes ne sont pas synonymes.
Graphe de connaissances et base de connaissances
Une base de connaissances peut prendre plusieurs formes.
Elle peut contenir :
- des documents ;
- des règles ;
- des définitions ;
- des faits ;
- des procédures ;
- un graphe ;
- des sources.
Le graphe de connaissances constitue donc une forme possible de base de connaissances, ou une partie de celle-ci.
Exemple dans la formation
Imaginons un système destiné à recommander des parcours pédagogiques.
Entités
Marie
Compétence SEO
Formation SEO débutant
Formation SEO intermédiaire
Formation SEO avancé
Certification SEO
Relations
Marie → possède → Compétence SEO débutant
Formation SEO intermédiaire → exige → Compétence SEO débutant
Formation SEO intermédiaire → développe → Compétence SEO intermédiaire
Formation SEO avancé → exige → Compétence SEO intermédiaire
Certification SEO → exige → Compétence SEO avancé
Le système peut déduire un parcours :
Marie
↓
Formation SEO intermédiaire
↓
Formation SEO avancé
↓
Certification SEO
Le graphe facilite la recommandation en reliant les compétences, les niveaux, les formations et les certifications.
Exemple dans le support technique
Entités
Incident 458
Routeur X200
Voyant rouge
Perte de synchronisation
Test de ligne
Procédure de réinitialisation
Technicien Paul
Relations
Incident 458 → concerne → Routeur X200
Incident 458 → présente → Voyant rouge
Voyant rouge → peut indiquer → Perte de synchronisation
Perte de synchronisation → est vérifiée par → Test de ligne
Perte de synchronisation → peut être traitée par → Procédure de réinitialisation
Technicien Paul → possède la compétence → Diagnostic réseau
Le système peut recommander :
- un test ;
- une procédure ;
- un technicien compétent ;
- un incident historique similaire.
Comment construire un graphe de connaissances ?
1. Définir les questions
Le graphe doit répondre à des questions précises.
Exemples :
- quelles personnes travaillent pour cette organisation ?
- quels produits sont compatibles ?
- quelles formations développent cette compétence ?
- quels documents mentionnent cet événement ?
- quelles causes peuvent expliquer ce symptôme ?
- quels incidents concernent ce composant ?
2. Définir le périmètre
Il faut déterminer ce qui sera représenté.
Un graphe de produits n’a pas nécessairement besoin de contenir toute l’histoire de l’entreprise.
3. Identifier les sources
Les données peuvent provenir :
- de bases de données ;
- de documents ;
- de fichiers ;
- d’API ;
- d’entretiens ;
- de pages web ;
- de systèmes internes ;
- de modèles de langage.
Les méthodes d’acquisition des connaissances permettent de structurer cette phase.
4. Définir le modèle
Le modèle précise :
- les types d’entités ;
- les types de relations ;
- les propriétés ;
- les contraintes ;
- les règles de nommage.
Cette étape peut s’appuyer sur une ontologie.
5. Extraire les entités
Depuis un texte comme :
Marie Dupont anime la formation SEO avancé organisée par Entreprise Alpha à Toulouse.
Le système peut extraire :
Marie Dupont → Personne
Formation SEO avancé → Formation
Entreprise Alpha → Organisation
Toulouse → Ville
6. Extraire les relations
Marie Dupont → anime → Formation SEO avancé
Formation SEO avancé → est organisée par → Entreprise Alpha
Entreprise Alpha → est située à → Toulouse
7. Résoudre les identités
Une même entité peut apparaître sous plusieurs formes.
Exemple :
Entreprise Alpha
Alpha SAS
Alpha
Société Alpha
Le système doit déterminer s’il s’agit de la même organisation.
Cette opération est appelée résolution d’entités ou réconciliation d’identités.
8. Fusionner les informations
Plusieurs sources peuvent fournir des informations complémentaires.
Source A :
Entreprise Alpha est située à Toulouse.
Source B :
Alpha SAS emploie Marie Dupont.
Si les deux noms correspondent à la même entité, les informations peuvent être réunies.
9. Ajouter les sources
Chaque fait important doit être relié à sa provenance.
Exemple :
Fait :
Marie travaille pour Entreprise Alpha.
Source :
Annuaire interne 2026.
Date :
12 juillet 2026.
Niveau de confiance :
Élevé.
10. Valider le graphe
Il faut tester :
- les types ;
- les relations ;
- les doublons ;
- les incohérences ;
- les identités ;
- les dates ;
- les sources ;
- les requêtes prévues.
La résolution d’entités
La résolution d’entités constitue l’une des difficultés principales.
Un système peut rencontrer :
Jean Dupont
J. Dupont
Jean P. Dupont
M. Dupont
Il doit déterminer :
- s’il s’agit de la même personne ;
- de plusieurs personnes ;
- d’un nom incomplet ;
- d’une ambiguïté non résolue.
Plusieurs critères peuvent être utilisés :
- adresse électronique ;
- entreprise ;
- date de naissance ;
- localisation ;
- identifiant interne ;
- contexte documentaire.
Une fusion incorrecte peut contaminer une grande partie du graphe.
La gestion des synonymes
Plusieurs termes peuvent désigner le même concept.
Exemple :
voiture
automobile
véhicule particulier
Le graphe peut conserver :
- un terme principal ;
- des synonymes ;
- des variantes ;
- des traductions ;
- des acronymes.
Cette gestion facilite la recherche et l’interprétation.
La provenance
Un graphe fiable doit conserver la provenance des connaissances.
Il faut pouvoir répondre à la question :
D’où vient cette information ?
Exemple :
Marie → travaille pour → Entreprise Alpha
peut provenir :
- d’un annuaire interne ;
- d’un contrat ;
- d’un profil professionnel ;
- d’une déclaration ;
- d’un document ancien.
Les sources ne possèdent pas toutes la même fiabilité.
Le temps et la validité
Une relation peut être vraie pendant une période déterminée.
Exemple :
Marie → travaille pour → Entreprise Alpha
avec :
date de début : janvier 2022
date de fin : mars 2026
Sans dimension temporelle, le graphe peut présenter une ancienne relation comme actuelle.
Le temps est particulièrement important pour :
- les postes ;
- les contrats ;
- les prix ;
- les réglementations ;
- les versions de produits ;
- les responsabilités ;
- les événements.
Le niveau de confiance
Certaines connaissances sont certaines.
D’autres sont probables ou contestées.
Exemple :
Voyant rouge → peut indiquer → Perte de synchronisation
Cette relation n’est pas une certitude.
Elle peut posséder :
niveau de confiance : 0,75
ou :
statut : hypothèse
Le graphe doit distinguer :
- les faits validés ;
- les hypothèses ;
- les estimations ;
- les informations contradictoires ;
- les propositions automatiques.
Les relations contradictoires
Deux sources peuvent affirmer :
Entreprise Alpha est située à Toulouse.
et :
Entreprise Alpha est située à Bordeaux.
Plusieurs explications sont possibles :
- l’entreprise a déménagé ;
- elle possède plusieurs établissements ;
- l’une des sources est ancienne ;
- les deux noms désignent des entreprises différentes ;
- une information est incorrecte.
Le système ne doit pas supprimer automatiquement la contradiction.
Il doit conserver le contexte et la provenance.
Interroger un graphe
Un graphe peut être interrogé de plusieurs manières.
Navigation directe
Exemple :
Marie
↓ travaille pour
Entreprise Alpha
↓ située à
Toulouse
Requête relationnelle
Question :
Quelles personnes possèdent une compétence SEO et travaillent pour une entreprise située à Toulouse ?
Le système suit plusieurs relations :
Personne
→ possède → Compétence SEO
→ travaille pour → Entreprise
→ située à → Toulouse
Langage de requête
Selon la technologie utilisée, le graphe peut être interrogé avec :
- SPARQL ;
- Cypher ;
- Gremlin ;
- une API ;
- un langage naturel traduit en requête.
L’utilisateur n’a pas nécessairement besoin de connaître le langage technique. Un LLM peut convertir une question en requête structurée.
Les principaux usages
Recherche sémantique
Le graphe permet de rechercher par concepts et relations, et pas uniquement par mots.
Recommandation
Il peut recommander :
- une formation ;
- un produit ;
- un expert ;
- un document ;
- une procédure ;
- un parcours.
Détection de relations
Il peut révéler des connexions indirectes entre plusieurs entités.
Intégration de données
Il permet de relier plusieurs bases utilisant des structures ou vocabulaires différents.
Assistance à la décision
Il peut fournir les faits, règles et sources nécessaires à une décision.
Conformité
Il peut relier :
- les obligations ;
- les documents ;
- les activités ;
- les contrôles ;
- les responsables.
Gestion des compétences
Il peut relier :
- les personnes ;
- les compétences ;
- les niveaux ;
- les formations ;
- les postes ;
- les certifications.
Graphe de connaissances et LLM
Un LLM peut interagir avec un graphe de connaissances de plusieurs manières.
Extraire des entités
Le modèle peut identifier les personnes, lieux, organisations et concepts présents dans un texte.
Proposer des relations
Il peut suggérer :
Marie → travaille pour → Entreprise Alpha
Traduire une question en requête
Question :
Quelles formations peuvent conduire à la certification X ?
Le modèle peut construire une requête sur les relations :
Formation → développe → Compétence
Certification X → exige → Compétence
Générer une réponse
Le graphe fournit les faits.
Le LLM les transforme en réponse lisible.
Expliquer une réponse
Le système peut présenter le chemin suivi :
Marie possède Compétence A.
Formation B exige Compétence A.
Formation B développe Compétence C.
Certification X exige Compétence C.
Conclusion :
Formation B constitue une étape pertinente pour Marie.
RAG et graphe de connaissances
Un système RAG classique recherche généralement des fragments de documents.
Exemple :
Question
↓
Recherche vectorielle
↓
Fragments pertinents
↓
Réponse du LLM
Cette méthode est efficace lorsque la réponse se trouve dans quelques passages.
Elle devient moins performante lorsque la question exige de relier :
- plusieurs documents ;
- plusieurs personnes ;
- plusieurs événements ;
- des relations indirectes ;
- une structure globale.
GraphRAG
GraphRAG ajoute un graphe de connaissances au processus.
Documents
↓
Extraction des entités et relations
↓
Construction du graphe
↓
Recherche dans le graphe et les textes
↓
Réponse du LLM
Le graphe aide le système à comprendre la structure générale du corpus.
Cette approche est étudiée dans la page GraphRAG.
Exemple : assistant documentaire
Une entreprise possède :
- des procédures ;
- des rapports ;
- des contrats ;
- des comptes rendus ;
- des fiches produits.
Un RAG classique peut retrouver les passages proches de la question.
Un graphe peut également relier :
Document → concerne → Produit
Document → mentionne → Incident
Incident → affecte → Client
Produit → est couvert par → Contrat
Contrat → impose → Délai d’intervention
Le système peut alors répondre à une question nécessitant plusieurs sources :
Quel délai d’intervention s’applique à l’incident affectant le produit du client Alpha ?
Qualité d’un graphe de connaissances
Un graphe de qualité doit posséder plusieurs caractéristiques.
Identités fiables
Les doublons et confusions doivent être limités.
Relations précises
Les relations doivent être clairement définies.
Provenance conservée
Chaque information importante doit être reliée à sa source.
Dimension temporelle
Les faits susceptibles d’évoluer doivent posséder des dates.
Cohérence
Le graphe doit respecter les contraintes du modèle.
Couverture suffisante
Il doit contenir les entités et relations nécessaires aux cas d’usage.
Mise à jour
Les données anciennes doivent être corrigées ou marquées comme obsolètes.
Explicabilité
Le système doit pouvoir montrer le chemin conduisant à une réponse.
Erreurs fréquentes
Confondre graphe et simple diagramme
Un schéma visuel n’est pas nécessairement un graphe exploitable par un système.
Utiliser des relations vagues
est lié à
ne précise pas la nature du lien.
Ignorer les identités
Deux noms proches ne désignent pas toujours la même entité.
Fusionner automatiquement les doublons
Une fusion incorrecte peut créer de fausses relations.
Oublier les sources
Un fait sans provenance est difficile à vérifier.
Oublier les dates
Une ancienne information peut être interprétée comme actuelle.
Considérer toutes les relations comme certaines
Certaines relations sont probables ou hypothétiques.
Créer un graphe sans questions précises
Le graphe risque de devenir volumineux mais inutilisable.
Confondre ontologie et graphe
L’ontologie définit le modèle. Le graphe contient les faits.
Laisser un LLM créer le graphe sans validation
Le modèle peut inventer des entités ou des relations.
Méthode minimale pour commencer
Étape 1
Choisir une question précise.
Exemple :
Quelles formations permettent d’acquérir une compétence donnée ?
Étape 2
Identifier les types d’entités.
Formation
Compétence
Participant
Certification
Étape 3
Définir les relations.
développe
possède
exige
valide
Étape 4
Créer quelques triplets.
Formation SEO → développe → Compétence SEO
Certification X → exige → Compétence SEO
Marie → possède → Compétence marketing
Étape 5
Tester des questions réelles.
Étape 6
Ajouter les sources et les dates.
Étape 7
Étendre progressivement le graphe.
Cette approche évite de construire un modèle trop large dès le départ.
À retenir
- Un graphe de connaissances représente des entités et leurs relations.
- Les connaissances sont souvent exprimées sous forme de triplets.
- Les nœuds représentent des entités ou des concepts.
- Les relations décrivent les liens entre les nœuds.
- Les propriétés ajoutent des informations aux entités et aux relations.
- L’ontologie définit souvent le modèle conceptuel du graphe.
- Une base de données graphe est une technologie, tandis qu’un graphe de connaissances possède une dimension sémantique.
- La résolution d’entités évite les doublons et les confusions.
- La provenance, les dates et le niveau de confiance sont essentiels.
- Un graphe peut relier des informations provenant de plusieurs documents.
- Les LLM peuvent interroger ou enrichir un graphe, mais leurs propositions doivent être validées.
- GraphRAG associe les graphes de connaissances aux modèles de langage.
Vérifiez votre compréhension
Qu’est-ce qu’un triplet ?
Un triplet est une affirmation organisée sous la forme sujet, relation, objet.
Qu’est-ce qu’un nœud ?
Un nœud représente une entité ou un concept.
Quelle différence existe-t-il entre ontologie et graphe ?
L’ontologie définit les concepts et relations possibles. Le graphe contient les entités concrètes et les relations observées.
Quelle différence existe-t-il entre base graphe et graphe de connaissances ?
La base graphe est une technologie de stockage. Le graphe de connaissances cherche à représenter explicitement le sens des données.
Pourquoi faut-il résoudre les identités ?
Pour éviter que la même entité soit représentée plusieurs fois ou que deux entités différentes soient fusionnées.
Pourquoi conserver les sources ?
Pour vérifier la fiabilité, l’origine et la date de chaque connaissance.
Quel rôle joue un graphe dans GraphRAG ?
Il permet au système de relier plusieurs entités et documents avant de produire une réponse.
Questions fréquentes
Un graphe de connaissances doit-il contenir une ontologie ?
Non, mais une ontologie améliore généralement la cohérence et la compréhension du graphe.
Un graphe peut-il contenir des documents ?
Il peut représenter les documents comme des entités et les relier à leurs auteurs, sujets, dates et concepts.
Peut-on créer un graphe à partir de textes ?
Oui. Des outils de traitement du langage et des LLM peuvent extraire des entités et relations, sous réserve de validation.
Un graphe de connaissances remplace-t-il une base de données ?
Non. Il peut compléter ou intégrer plusieurs bases de données.
Quelle taille peut avoir un graphe ?
Il peut contenir quelques dizaines ou plusieurs milliards d’entités. La taille dépend du cas d’usage et de l’infrastructure.
Un graphe améliore-t-il toujours un RAG ?
Non. Il apporte surtout de la valeur lorsque les réponses exigent des relations, des parcours ou une compréhension globale du corpus.
Continuer le parcours
Étape précédente
Ontologie informatique : définition et construction
Étape suivante
La prochaine étape consiste à comprendre comment une base de connaissances peut réunir des graphes, des règles, des documents et des sources.
➡️ Base de connaissances : définition, structure et fonctionnement