Outils de Knowledge Engineering : quelles technologies utiliser ?
Les outils de Knowledge Engineering permettent de recueillir, structurer, représenter, stocker, interroger, valider et exploiter les connaissances.
Ils ne répondent pas tous au même besoin.
Un tableur peut suffire pour construire un premier vocabulaire. Un éditeur d’ontologie devient utile lorsque les concepts et les contraintes doivent être formalisés. Une base graphe permet de stocker des entités fortement reliées. Un moteur de règles applique des décisions explicites. Un index vectoriel facilite la recherche sémantique dans les documents.
Le choix d’un outil doit donc intervenir après la définition :
- du problème ;
- des utilisateurs ;
- des questions à traiter ;
- des connaissances nécessaires ;
- du niveau de formalisation ;
- des contraintes techniques.
L’outil ne détermine pas la qualité du système. Il met en œuvre une représentation des connaissances qui doit d’abord être pensée.
Cette page prolonge la méthode d’ingénierie des connaissances.
Ce que vous allez comprendre
À la fin de cet article, vous saurez :
- distinguer les principales familles d’outils ;
- choisir entre tableur, ontologie, graphe, règles et index vectoriel ;
- comprendre le rôle de RDF, OWL, SPARQL et SHACL ;
- identifier les fonctions de Protégé et WebProtégé ;
- distinguer une base graphe orientée propriétés d’un triplestore RDF ;
- comprendre comment relier les outils à un LLM ;
- construire une pile technique progressive.
Commencer par les besoins, pas par les logiciels
Avant de choisir un outil, il faut préciser ce que le système devra accomplir.
| Besoin | Outil ou méthode possible |
|---|---|
| Recueillir le vocabulaire | Tableur, document partagé |
| Construire une taxonomie | Tableur, outil de taxonomie |
| Modéliser une ontologie | Protégé, WebProtégé |
| Représenter des triplets | RDF |
| Définir des classes et contraintes logiques | OWL |
| Interroger un graphe RDF | SPARQL |
| Valider la structure des données RDF | SHACL |
| Stocker des entités fortement reliées | Base de données graphe |
| Appliquer des décisions explicites | Moteur de règles |
| Rechercher dans des documents | Moteur de recherche |
| Rechercher par similarité sémantique | Index vectoriel |
| Générer des réponses en langage naturel | LLM |
| Relier documents, entités et relations | GraphRAG |
Cette table ne constitue pas une correspondance absolue.
Un même projet peut combiner plusieurs technologies.
Les outils d’acquisition des connaissances
L’acquisition des connaissances ne nécessite pas immédiatement un logiciel spécialisé.
Les outils les plus simples sont souvent les plus efficaces pendant les premières étapes.
Le traitement de texte
Un document partagé permet de recueillir :
- les définitions ;
- les entretiens ;
- les procédures ;
- les exemples ;
- les désaccords ;
- les règles candidates ;
- les questions ouvertes.
Il convient particulièrement à la phase d’exploration.
Le tableur
Un tableur permet de construire rapidement :
- un glossaire ;
- une liste de concepts ;
- une matrice de sources ;
- une liste de règles ;
- un tableau de synonymes ;
- une liste de relations ;
- un registre des connaissances.
Exemple :
| Concept | Définition | Synonyme | Source | Statut |
|---|---|---|---|---|
| Formation | Programme destiné à développer une compétence | Parcours | Catalogue | Validé |
| Session | Mise en œuvre datée d’une formation | Stage | Équipe pédagogique | Validé |
Le tableur devient limité lorsque :
- les relations sont nombreuses ;
- plusieurs personnes modifient le modèle ;
- les contraintes doivent être contrôlées ;
- les dépendances deviennent complexes.
Les cartes conceptuelles
Une carte conceptuelle permet de représenter visuellement :
- les concepts ;
- les sous-concepts ;
- les relations ;
- les causes ;
- les effets ;
- les processus.
Exemple :
Formation
├── développe → Compétence
├── exige → Prérequis
├── est animée par → Formateur
└── est mise en œuvre dans → Session
Elle constitue souvent une bonne étape intermédiaire entre les entretiens et l’ontologie formelle.
Les outils d’analyse documentaire
Les outils d’analyse documentaire peuvent aider à :
- extraire du texte ;
- rechercher des expressions ;
- identifier les occurrences ;
- comparer des versions ;
- détecter des entités ;
- classer les documents ;
- extraire les métadonnées.
Les LLM peuvent également proposer :
- des résumés ;
- des concepts ;
- des relations ;
- des règles candidates ;
- des questions de validation.
Le résultat doit rester relié aux documents d’origine et être vérifié.
Les outils de taxonomie
Une taxonomie peut être construite avec :
- un tableur ;
- un système de gestion de contenu ;
- un outil de gestion de vocabulaires ;
- un éditeur SKOS ;
- une application personnalisée.
Les fonctions utiles comprennent :
- création de catégories ;
- relations parent-enfant ;
- synonymes ;
- termes préférés ;
- notes de définition ;
- traductions ;
- import et export ;
- gestion des versions.
SKOS
SKOS est un modèle utilisé pour représenter des vocabulaires contrôlés, des thésaurus et des systèmes de concepts.
Il permet notamment de distinguer :
- un terme préféré ;
- un synonyme ;
- un concept plus général ;
- un concept plus spécifique ;
- un concept associé.
Exemple conceptuel :
Concept : Graphe de connaissances
Terme préféré : Graphe de connaissances
Synonyme : Knowledge graph
Concept plus général : Représentation des connaissances
Concept associé : Ontologie
SKOS est souvent plus adapté qu’OWL lorsque l’objectif principal consiste à organiser un vocabulaire documentaire.
Les éditeurs d’ontologies
Un éditeur d’ontologie permet de définir :
- les classes ;
- les sous-classes ;
- les individus ;
- les propriétés ;
- les relations ;
- les restrictions ;
- les annotations ;
- les axiomes.
Protégé Desktop
Protégé Desktop est un éditeur d’ontologies utilisé pour construire et gérer des modèles OWL.
Il permet notamment de :
- créer des classes ;
- définir des propriétés ;
- ajouter des individus ;
- visualiser la hiérarchie ;
- connecter un raisonneur ;
- vérifier certaines incohérences ;
- importer plusieurs ontologies.
Il convient aux projets nécessitant un contrôle direct et local du modèle.
WebProtégé
WebProtégé propose une interface accessible depuis un navigateur.
Il facilite notamment :
- la collaboration ;
- les commentaires ;
- la discussion autour des concepts ;
- le suivi des modifications ;
- le travail réparti entre experts et modélisateurs.
Le choix entre une application locale et une plateforme collaborative dépend de l’organisation du projet.
RDF
RDF, ou Resource Description Framework, est un modèle de représentation de l’information sous forme de graphe.
Il repose sur des affirmations de type :
Sujet → prédicat → objet
Exemple :
Marie → anime → Formation SEO
Formation SEO → développe → Compétence SEO
Les affirmations RDF peuvent être combinées pour former un graphe.
RDF facilite notamment :
- l’échange de données ;
- la liaison entre plusieurs sources ;
- l’utilisation d’identifiants globaux ;
- l’interrogation de graphes ;
- l’application de modèles sémantiques.
RDFS
RDF Schema, ou RDFS, ajoute un vocabulaire permettant de décrire :
- les classes ;
- les sous-classes ;
- les propriétés ;
- les domaines ;
- les portées des relations.
Exemple :
Formateur est une sous-classe de Personne.
anime possède pour domaine Formateur.
anime possède pour portée Session.
RDFS apporte une première couche de modélisation au-dessus de RDF.
OWL
OWL est un langage d’ontologie plus expressif.
Il permet notamment de représenter :
- des classes ;
- des propriétés ;
- des équivalences ;
- des incompatibilités ;
- des cardinalités ;
- des restrictions ;
- des relations inverses ;
- des relations transitives.
Exemple :
Toute formation avancée doit posséder au moins un prérequis.
Personne et Organisation sont des classes disjointes.
OWL devient pertinent lorsque le système doit effectuer des inférences ou contrôler un modèle conceptuel précis.
SPARQL
SPARQL est un langage permettant d’interroger des graphes RDF.
Une requête peut demander :
- quelles formations développent une compétence ;
- quelles personnes travaillent pour une organisation ;
- quels produits sont compatibles ;
- quels incidents concernent un composant ;
- quelles sources justifient une relation.
Exemple conceptuel :
SELECT ?formation
WHERE {
?formation :developpe :CompetenceSEO .
}
Le résultat contient les formations reliées à la compétence SEO.
SHACL
SHACL permet de définir des contraintes de validation appliquées à des graphes RDF.
Une forme SHACL peut indiquer :
Une session doit posséder exactement une date de début.
Une formation doit développer au moins une compétence.
Le prix doit être un nombre positif.
SHACL permet ensuite de produire un rapport indiquant :
- les données conformes ;
- les avertissements ;
- les violations ;
- les contraintes non respectées.
OWL et SHACL ne remplissent pas exactement la même fonction.
- OWL décrit principalement le sens et les inférences possibles.
- SHACL contrôle si les données respectent une forme attendue.
Les raisonneurs
Un raisonneur analyse une ontologie et peut produire des conclusions implicites.
Exemple :
Formateur est une sous-classe de Personne.
Marie est une instance de Formateur.
Le raisonneur peut conclure :
Marie est une Personne.
Il peut également détecter certaines incohérences.
Exemple :
Personne et Organisation sont disjointes.
Entreprise Alpha est une Personne.
Entreprise Alpha est une Organisation.
Le modèle contient alors une contradiction.
Les bibliothèques RDF
Des bibliothèques logicielles permettent de manipuler RDF dans une application.
Elles peuvent fournir :
- lecture et écriture de graphes ;
- parsing de formats RDF ;
- requêtes SPARQL ;
- sérialisation ;
- validation ;
- gestion des namespaces ;
- connexion à un triplestore.
Exemples de familles d’outils :
- bibliothèques Python ;
- frameworks Java ;
- bibliothèques JavaScript ;
- API de bases sémantiques.
Le choix dépend du langage utilisé pour construire l’application.
Les triplestores RDF
Un triplestore est une base conçue pour stocker et interroger des triplets RDF.
Il permet généralement :
- l’import RDF ;
- les requêtes SPARQL ;
- la gestion de plusieurs graphes ;
- l’inférence ;
- la validation ;
- l’accès par API.
Exemples de plateformes de cette famille :
- GraphDB ;
- Stardog ;
- Apache Jena ;
- RDF4J ;
- solutions commerciales ou cloud compatibles RDF.
Les bases graphes orientées propriétés
Une base graphe orientée propriétés représente :
- des nœuds ;
- des relations ;
- des propriétés sur les nœuds ;
- des propriétés sur les relations.
Exemple :
Nœud : Marie
type : Personne
Marie -[TRAVAILLE_POUR depuis 2022]-> Entreprise Alpha
Cette approche convient bien aux parcours relationnels et aux applications opérationnelles.
Neo4j constitue un exemple connu de cette famille.
RDF ou graphe de propriétés ?
| RDF | Graphe de propriétés |
|---|---|
| Fondé sur des triplets | Fondé sur des nœuds et relations |
| Utilise souvent SPARQL | Utilise souvent un langage propre au moteur |
| Adapté aux standards sémantiques | Adapté aux parcours opérationnels |
| Facilite l’intégration de vocabulaires | Facilite les propriétés sur les relations |
| Compatible avec OWL et SHACL | Compatible avec des schémas spécifiques |
| Orienté interopérabilité | Orienté développement applicatif |
Le choix dépend notamment :
- du besoin d’interopérabilité ;
- du type de requêtes ;
- des standards imposés ;
- de l’écosystème technique ;
- du niveau de raisonnement attendu.
Les moteurs de règles
Un moteur de règles exécute des règles du type :
SI conditions
ALORS conclusion ou action
Exemple :
SI le participant ne possède pas le niveau requis
ALORS recommander une formation préparatoire.
Les fonctions utiles comprennent :
- priorités ;
- gestion des conflits ;
- chaînage avant ;
- chaînage arrière ;
- explication ;
- journal des règles appliquées ;
- versionnement.
Un moteur de règles peut être associé à une base de connaissances.
Les moteurs de recherche textuelle
Un moteur de recherche textuelle indexe :
- les mots ;
- les expressions ;
- les titres ;
- les métadonnées ;
- les champs ;
- les documents.
Il convient notamment à :
- la recherche documentaire ;
- la recherche exacte ;
- les filtres ;
- les facettes ;
- la recherche par expressions.
La recherche par mots reste importante, même dans une architecture utilisant des embeddings.
Les bases et index vectoriels
Une base vectorielle stocke les représentations numériques de contenus.
Elle permet de rechercher des fragments proches sémantiquement.
Exemple :
voiture électrique
peut être rapproché de :
automobile alimentée par batterie
La recherche vectorielle est particulièrement utile pour :
- le RAG ;
- la recherche sémantique ;
- la recommandation ;
- la détection de contenus proches ;
- le regroupement de documents.
Elle ne représente pas automatiquement :
- les règles ;
- les contraintes ;
- les relations métier ;
- les exceptions ;
- les temporalités.
Les outils LLM
Un LLM peut intervenir pour :
- analyser une question ;
- extraire des concepts ;
- identifier des entités ;
- proposer des relations ;
- résumer ;
- reformuler ;
- traduire une question en requête ;
- rédiger la réponse finale.
Il doit être relié à :
- des sources contrôlées ;
- des instructions ;
- des outils ;
- des filtres ;
- des mécanismes de validation.
Le rôle des LLM est développé dans Knowledge Engineering, RAG et LLM.
Les outils GraphRAG
Une architecture GraphRAG peut combiner :
- extraction documentaire ;
- reconnaissance d’entités ;
- résolution d’identités ;
- construction du graphe ;
- recherche vectorielle ;
- requêtes graphe ;
- résumés de communautés ;
- LLM.
Il n’existe pas une seule architecture GraphRAG.
Le choix dépend du corpus et des questions.
Les outils de validation
La validation peut porter sur plusieurs niveaux.
Validation documentaire
- source présente ;
- date correcte ;
- version active ;
- auteur identifié.
Validation sémantique
- classe correcte ;
- relation autorisée ;
- terme non ambigu ;
- domaine et portée cohérents.
Validation logique
- absence de contradiction ;
- contraintes respectées ;
- inférences attendues.
Validation fonctionnelle
- réponses correctes ;
- cas limites traités ;
- refus appropriés ;
- explications disponibles.
Les outils de test
Un système doit conserver un jeu de questions de référence.
Exemple :
Question :
Marie peut-elle suivre la formation avancée ?
Faits :
Marie possède le niveau débutant.
La formation exige le niveau intermédiaire.
Réponse attendue :
Non. Une formation préparatoire doit être recommandée.
Les tests peuvent être automatisés afin de détecter les régressions.
Les outils de gouvernance
La gouvernance nécessite souvent :
- gestion des rôles ;
- journal des modifications ;
- validation ;
- versionnement ;
- commentaires ;
- historique ;
- date d’expiration ;
- workflow de publication.
Une connaissance peut suivre :
Brouillon
↓
À valider
↓
Validée
↓
Publiée
↓
À réviser
↓
Obsolète
Les outils de documentation
Un projet doit documenter :
- le vocabulaire ;
- l’ontologie ;
- les règles ;
- les sources ;
- les décisions de modélisation ;
- les API ;
- les tests ;
- les responsabilités.
Le Markdown, les wikis et les générateurs de documentation peuvent suffire.
Construire une pile progressive
Il n’est pas nécessaire de commencer avec une infrastructure complexe.
Niveau 1 — Documentation structurée
Markdown
+
Tableur
+
Navigation
+
Recherche
Adapté à :
- un site pédagogique ;
- une FAQ ;
- une petite documentation ;
- un premier glossaire.
Niveau 2 — Base documentaire enrichie
Documents
+
Métadonnées
+
Taxonomie
+
Moteur de recherche
Adapté à :
- un support interne ;
- un corpus réglementaire ;
- une documentation produit.
Niveau 3 — RAG
Documents
+
Index vectoriel
+
Filtres
+
LLM
Adapté à :
- un assistant documentaire ;
- une recherche conversationnelle ;
- une synthèse de sources.
Niveau 4 — Connaissances structurées
Ontologie
+
Graphe
+
Règles
+
Documents
Adapté à :
- des relations complexes ;
- des contraintes ;
- des décisions explicables.
Niveau 5 — Architecture hybride
Documents
+
Index vectoriel
+
Graphe
+
Règles
+
LLM
+
Évaluation
+
Gouvernance
Adapté aux systèmes critiques ou fortement intégrés.
Exemple de choix pour un petit projet
Objectif :
Construire un assistant capable de répondre aux questions sur un catalogue de formations.
Première version :
- fichiers Markdown ;
- front matter ;
- taxonomie ;
- recherche textuelle ;
- liens internes.
Deuxième version :
- index vectoriel ;
- RAG ;
- citations.
Troisième version :
- graphe entre formations, compétences et prérequis ;
- règles d’éligibilité ;
- recommandations personnalisées.
Cette progression évite la complexité prématurée.
Critères de sélection
Avant de retenir un outil, évaluez :
Le besoin fonctionnel
Que doit faire le système ?
Le niveau de formalisation
Faut-il seulement classer ou également raisonner ?
Le volume
Combien de documents, entités et relations ?
La collaboration
Combien de personnes modifieront le modèle ?
L’interopérabilité
Les connaissances doivent-elles être partagées entre plusieurs systèmes ?
La sécurité
Quels droits d’accès doivent être respectés ?
La maintenance
Qui assurera les mises à jour ?
Les compétences disponibles
L’équipe maîtrise-t-elle les technologies choisies ?
Le coût
Il faut prendre en compte :
- licences ;
- hébergement ;
- développement ;
- maintenance ;
- formation ;
- validation humaine.
Erreurs fréquentes
Choisir un outil avant le besoin
Le projet s’adapte ensuite artificiellement au logiciel.
Utiliser une ontologie pour une simple liste
Une taxonomie ou un tableur aurait suffi.
Utiliser uniquement un index vectoriel
Les règles et relations restent implicites.
Installer trop de composants
Chaque composant ajoute de la maintenance.
Négliger les standards
Le système devient difficile à migrer ou à intégrer.
Négliger l’expérience utilisateur
Une ontologie parfaite peut rester inutilisable.
Ne pas prévoir les tests
Les modifications peuvent dégrader les résultats.
Confier l’extraction entièrement à un LLM
Les erreurs deviennent difficiles à détecter.
À retenir
- Les outils doivent être choisis après le cas d’usage.
- Un traitement de texte et un tableur suffisent souvent pour commencer.
- Protégé et WebProtégé servent à construire des ontologies.
- RDF représente l’information sous forme de graphe.
- RDFS décrit des classes et des propriétés.
- OWL apporte une sémantique et des contraintes plus expressives.
- SPARQL permet d’interroger les graphes RDF.
- SHACL permet de valider leur structure.
- Une base graphe stocke efficacement les entités et leurs relations.
- Un index vectoriel permet la recherche sémantique.
- Un moteur de règles applique des décisions explicites.
- Une architecture hybride combine documents, graphes, règles et LLM.
Vérifiez votre compréhension
Quel outil utiliser pour commencer un glossaire ?
Un tableur peut suffire.
À quoi sert Protégé ?
À construire et modifier des ontologies, notamment en OWL.
Quelle différence existe-t-il entre RDF et OWL ?
RDF représente des affirmations sous forme de graphes. OWL permet de définir des ontologies plus expressives.
À quoi sert SPARQL ?
À interroger des données RDF.
À quoi sert SHACL ?
À vérifier que les données respectent des contraintes définies.
Quelle différence existe-t-il entre un graphe et un index vectoriel ?
Le graphe représente des relations explicites. L’index vectoriel représente principalement des proximités sémantiques.
Questions fréquentes
Faut-il utiliser Protégé pour tout projet ?
Non. Il devient pertinent lorsque le projet nécessite une ontologie explicite.
RDF est-il une base de données ?
Non. RDF est un modèle de représentation. Il peut être stocké dans un triplestore.
Peut-on utiliser Neo4j sans ontologie ?
Oui. Une ontologie améliore toutefois la cohérence d’un knowledge graph complexe.
Une base vectorielle est-elle une base de connaissances ?
Elle peut en constituer un composant, mais elle ne représente pas automatiquement les règles et relations métier.
Peut-on utiliser plusieurs outils ensemble ?
Oui. Les architectures hybrides sont fréquentes.
Quel est le meilleur outil ?
Celui qui répond au besoin avec le niveau de complexité minimal nécessaire.
Continuer le parcours
Étape précédente
Méthode d’ingénierie des connaissances
Étape suivante
La prochaine étape consiste à observer comment ces méthodes et outils sont utilisés dans des situations concrètes.
➡️ Cas d’usage du Knowledge Engineering