Apprendre à une ontologie à lire des documents d'ingénierie routière : une plateforme de métadonnées sémantique dopée à l'AI pour le DOT de l'État de Washington.
National Cooperative Highway Research Program, Transportation Research Board, National Academies of Sciences Engineering and Medicine · Secteur public
Automatiser la classification des contenus et la recherche pour la base de connaissances d'ingénierie d'une agence de transport d'État

Résumé exécutif
Le Washington State Department of Transportation (WSDOT) gère l'un des plus grands réseaux routiers d'État du pays, et ses ingénieurs dépendent d'une bibliothèque en croissance constante de manuels de conception, de spécifications standard et de rapports techniques pour faire leur travail de manière sûre et cohérente. Dans le cadre d'une initiative nationale de recherche parrainée par le National Cooperative Highway Research Program (NCHRP) visant à améliorer la trouvabilité de l'information dans les agences de transport des États, le WSDOT a entrepris de démontrer que l'application de métadonnées automatisées à son contenu d'ingénierie pouvait améliorer de manière mesurable la navigation ainsi que la précision et le rappel de la recherche. Iknow, intervenant comme sous-traitant du contractant principal de recherche Spy Pond Partners, a été chargé de concevoir et d'intégrer la plateforme technologique rendant cela possible.
Iknow a construit une plateforme d'IA sémantique à sept composants (ancrée dans une ontologie construite sur mesure, un entrepôt de triplets à la manière d'un graphe de connaissances et une chaîne de traitement du langage naturel) qui lisait, interprétait et étiquetait automatiquement les documents d'ingénierie du WSDOT, puis livrait ces métadonnées à un moteur de recherche d'entreprise moderne. La plateforme a correctement classé plus de 2 000 documents au fil de plusieurs séries de tests, et les ingénieurs du WSDOT ont confirmé que les résultats répondaient à leurs attentes en matière d'exactitude. La méthodologie et les résultats ont été documentés dans le NCHRP Research Report 947, offrant aux autres DOT d'État un modèle éprouvé et reproductible pour le même problème de trouvabilité.
Contexte et historique
À propos du client
Le WSDOT est l'agence d'État chargée de construire, d'entretenir et d'exploiter le système de transport multimodal de l'État de Washington, y compris ses autoroutes, ses traversiers et ses corridors ferroviaires. Le département est responsable de plus de 20 000 milles-voies de chaussée et de près de 3 000 ponts routiers, et fonctionne avec un budget biennal dépassant 11 milliards de dollars. Une agence de cette envergure génère un corpus de connaissances d'ingénierie en expansion continue (manuels de conception, spécifications, documentation environnementale et dossiers de projets) que les ingénieurs doivent pouvoir trouver rapidement et auquel ils doivent pouvoir se fier entièrement.
Contexte sectoriel
Les départements des transports des États partagent un défi commun : ils comptent parmi les organisations d'ingénierie les plus documentaires du secteur public, et pourtant la plupart ont été bâtis sur des systèmes de contenu conçus pour le stockage et le contrôle de versions plutôt que pour aider les ingénieurs à trouver le bon concept parmi des milliers de documents techniques. Le NCHRP, un programme national de recherche mutualisée financé par les DOT d'État et administré par l'AASHTO et le Transportation Research Board, avait déjà publié le NCHRP Report 846, Improving Findability and Relevance of Transportation Information, qui exposait le problème. La mission du WSDOT avec Iknow et Spy Pond Partners constituait la phase appliquée, d'intégration technologique, de cette recherche, documentée par la suite aux côtés de pilotes parallèles d'autres DOT d'État dans le NCHRP Research Report 947. Les plateformes de contenu commerciales utilisées par les agences publiques d'infrastructure sont généralement solides en matière de stockage et de contrôle de versions, mais rares sont celles qui incluent une couche sémantique capable de comprendre qu'un ponceau est un type d'actif de drainage — l'écart que le WSDOT a demandé à Iknow de combler.
Situation actuelle
Le WSDOT utilisait déjà le système de gestion de contenu Drupal, adossé à une base de données MySQL, pour stocker, présenter et gérer ses connaissances, procédures et spécifications d'ingénierie. Ce qui lui manquait était un moyen d'enrichir ce contenu de métadonnées au niveau des concepts à grande échelle, le socle nécessaire pour dépasser la recherche par mots-clés et atteindre une précision et un rappel véritables. Le WSDOT a engagé Iknow, par l'intermédiaire du contractant principal Spy Pond Partners, pour intégrer un logiciel capable d'auto-classifier les documents d'ingénierie au fil de leur ingestion.
Problème / défi
- Un contenu d'ingénierie que la recherche en texte brut ne pouvait pas servir correctement. La bibliothèque du WSDOT fondée sur Drupal contenait des milliers de documents, mais la recherche classique par mots-clés ne pouvait pas saisir les relations entre concepts d'ingénierie (par exemple, qu'un ponceau est un type d'actif de drainage), de sorte que des résultats pertinents pouvaient facilement échapper.
- Aucun moyen évolutif d'appliquer des métadonnées. Étiqueter manuellement la bibliothèque documentaire existante et en croissance continue du WSDOT avec des métadonnées cohérentes et significatives n'était pas réaliste compte tenu des contraintes de personnel et de budget du département.
- Une solution devant fonctionner au sein des systèmes existants, et non les remplacer. Toute plateforme devait s'intégrer à l'environnement Drupal et MySQL existant du WSDOT plutôt que d'exiger un remplacement coûteux et perturbateur — une contrainte réelle pour une agence financée par des fonds publics.
- Une approche non éprouvée qu'il fallait démontrer, et non présumer. Parce que la prémisse (que l'enrichissement de contenu et la classification computationnelle pouvaient améliorer la trouvabilité) était elle-même l'objet de la recherche, la mission devait produire des preuves, et pas seulement un système fonctionnel.
Objectifs du projet
- Démontrer que l'enrichissement de contenu et la classification computationnelle pouvaient améliorer la navigation ainsi que la précision et le rappel de la recherche.
- Intégrer des composants logiciels dans l'environnement Drupal et MySQL existant du WSDOT pour auto-classifier les documents au fil de leur ingestion.
- Construire une ontologie propre au domaine décrivant les relations sémantiques et lexicales entre les concepts d'ingénierie du WSDOT.
- Valider la plateforme obtenue par rapport à la bibliothèque documentaire du WSDOT et confirmer son exactitude auprès des ingénieurs qui s'y fieraient.
L’approche d’Iknow
Comment Iknow a structuré le travail
Iknow a conçu et intégré une plateforme de traitement des métadonnées à sept composants qui superposait des capacités d'IA sémantique à l'environnement Drupal et MySQL existant du WSDOT plutôt que de le remplacer, orchestrée par un composant d'intégration construit sur mesure, Taggr.
Activités et décisions clés
- Développement de l'ontologie. À l'aide de Protégé, une plateforme open source de construction de modèles de domaines de connaissances, Iknow a construit une ontologie décrivant les relations sémantiques entre les concepts d'ingénierie du WSDOT, élaborée à partir d'une taxonomie de relations de classes parent-enfant.
- Graphe de connaissances et extraction sémantique. Iknow a déployé Apache Jena pour appliquer cette ontologie au corpus documentaire du WSDOT, en extrayant les relations entre concepts sous forme de triplets sémantiques (par exemple, qu'un ponceau est un type d'actif de drainage) et en les stockant dans un entrepôt de triplets conçu pour des données sémantiques interconnectées.
- Prétraitement du langage naturel. Iknow a intégré Google Cloud NLP pour lemmatiser le texte des documents, noter les termes selon leur saillance et éliminer les mots de faible valeur, produisant une liste propre et à fort signal de concepts par document.
- Couche d'intégration sur mesure. Iknow a construit Taggr comme le tissu conjonctif de la plateforme : il normalisait la casse du texte, acheminait le contenu vers le moteur de NLP, confrontait les termes à forte saillance à l'entrepôt de triplets de l'ontologie et écrivait les étiquettes dans les formulaires de contenu Drupal du WSDOT.
- Intégration de la recherche d'entreprise. Iknow a connecté le contenu nouvellement étiqueté à Apache Solr, une plateforme de recherche open source, afin que les ingénieurs puissent retrouver les documents en utilisant les relations entre concepts établies par la plateforme.
- Tests de validation. Iknow a fait tourner la plateforme sur le corpus documentaire du WSDOT au fil de plusieurs séries de tests, classant avec succès plus de 2 000 documents et confirmant les résultats auprès des ingénieurs du WSDOT.
Parties prenantes et collaboration
Iknow est intervenu comme sous-traitant du contractant principal de recherche Spy Pond Partners au sein d'un projet de recherche parrainé par le NCHRP et supervisé par l'AASHTO, en coordination directe avec le personnel d'ingénierie et informatique du WSDOT pour ancrer la plateforme dans un contenu réel et en valider les résultats.
Les défis et comment Iknow les a surmontés
Introduire l'IA sémantique dans un environnement hérité aux ressources limitées
Une pile technologique sémantique construite de toutes pièces risquait d'être trop coûteuse et perturbatrice pour les systèmes et le budget existants d'une agence publique. Iknow y a répondu en construisant l'essentiel de la plateforme (six composants sur sept) sur des logiciels open source librement disponibles, et en concevant Taggr comme une fine couche d'intégration fonctionnant avec l'environnement Drupal et MySQL existant du WSDOT plutôt que d'exiger son remplacement.
Atteindre une exactitude véritable dans le domaine de l'ingénierie
Un modèle de classification du commerce ne comprendrait pas suffisamment le vocabulaire d'ingénierie propre au WSDOT pour produire des résultats dignes de confiance. Iknow y a répondu en construisant à dessein une ontologie autour des propres concepts d'ingénierie du WSDOT et en validant la sortie de la plateforme par rapport à la bibliothèque documentaire du WSDOT au fil de plusieurs séries de tests avec les ingénieurs du WSDOT, plutôt que de considérer une seule passe de test comme une preuve suffisante.
Résultats et impact
Résultats quantitatifs
- Documents classés : plus de 2 000 documents d'ingénierie, correctement auto-classifiés au fil de plusieurs séries de tests.
- Composants technologiques intégrés : sept, dont six outils open source et un module d'intégration construit sur mesure (Taggr).
- Exactitude de la recherche : confirmée par les ingénieurs du WSDOT comme répondant aux attentes du département en matière de précision et de rappel.
Résultats qualitatifs
Les ingénieurs du WSDOT ont acquis la capacité de rechercher le contenu d'ingénierie par concept sous-jacent plutôt que par mot-clé exact, en trouvant par exemple tous les documents liés à une classe d'actifs de drainage même lorsque les documents individuels employaient une terminologie différente. Le graphe de connaissances piloté par ontologie qu'Iknow a construit anticipait une approche depuis devenue courante, de nombreuses organisations poursuivant aujourd'hui des architectures sémantiques similaires fondées sur la récupération à l'aide de grands modèles de langage. La mission étant un pilote de recherche du NCHRP, sa méthodologie et ses résultats ont été documentés dans le NCHRP Research Report 947, publié à l'intention de tous les DOT d'État membres de l'AASHTO.
Délai avant impact
Iknow a livré une plateforme validée et opérationnelle dans le cadre de la période d'exécution d'environ 20 mois de la mission, l'exactitude étant confirmée sur le contenu et auprès des ingénieurs mêmes du WSDOT avant la conclusion de la recherche. Les conclusions ont été publiées à l'échelle nationale en 2020, offrant aux autres DOT d'État un modèle fondé sur des preuves, utilisable immédiatement.
Les capacités d’Iknow démontrées
Compétences clés
- Stratégie de métadonnées et de taxonomie
- IA sémantique / développement d'ontologies
- Architecture de recherche d'entreprise
- Intégration de systèmes hérités
Méthodes et cadres
- Ingénierie d'ontologies et de graphes de connaissances
- Enrichissement de contenu fondé sur le NLP
- Intégration de plateforme par phases et tests de validation
Technologies et outils
- Drupal, MySQL et Protégé
- Apache Jena, Apache Solr et Google Cloud NLP
- Module d'intégration Taggr construit sur mesure
Mettez cette expérience au service de votre problème.
Une grande partie de notre travail ne figure jamais sur le site. Réservez un appel, indiquez-nous votre secteur et nous vous présenterons les missions qui correspondent au vôtre.
