Rendre trouvables 5,000 pages de manuels d'ingénierie : un pilote de recherche sémantique pour les DOT des États.
National Cooperative Highway Research Program, Transportation Research Board, National Academies of Sciences Engineering and Medicine, and the Department of Transportation, State of Washington · Secteur public
Analyse de texte, conception d'ontologie et autoclassification pour les manuels de référence d'ingénierie du WSDOT

Résumé exécutif
Le National Cooperative Highway Research Program (NCHRP) et le département des Transports de l'État de Washington (WSDOT) ont parrainé conjointement un projet de recherche visant à résoudre un problème bien connu des agences de transport de tous les États. Le WSDOT publie à lui seul 60 manuels de référence d'ingénierie sur lesquels les ingénieurs de l'État s'appuient pour planifier et exécuter les projets d'infrastructure, tous au format PDF standard sans aucune possibilité de recherche électronique. Les ingénieurs devaient faire défiler manuellement les PDF pour trouver les orientations techniques dont ils avaient besoin.
Iknow, intervenant comme sous-traitant du contractant principal Spy Pond Partners, a construit le système pilote du projet, transformant huit manuels du WSDOT consacrés aux eaux pluviales, totalisant plus de 5 000 pages de texte non interrogeable, en une application de recherche à facettes pilotée par des ontologies. À l'aide d'un processus en quatre étapes couvrant la fouille de texte, la conception d'ontologies et la classification automatisée, Iknow a intégré six outils logiciels open source et propriétaires dans un pilote opérationnel démontrant comment l'analyse de texte, l'autoclassification et l'apprentissage automatique pouvaient rendre des milliers de pages de contenu technique réellement trouvables, orientant directement la stratégie de trouvabilité ultérieure du WSDOT.
Contexte et historique
À propos du client
Le NCHRP a été créé en 1962 par l'American Association of State Highway and Transportation Officials (AASHTO) comme un programme national de recherche financé de manière coopérative, consacré aux problèmes communs aux départements des transports des États. Il est administré par le Transportation Research Board, qui relève des National Academies of Sciences, Engineering, and Medicine, en coopération avec la Federal Highway Administration, et financé par les contributions de chaque DOT d'État. Le WSDOT, l'une des agences d'État parrainant le NCHRP, publie 60 manuels de référence d'ingénierie couvrant tous les domaines, de l'hydraulique à la conformité environnementale, sur lesquels ses ingénieurs s'appuient quotidiennement.
Contexte sectoriel
Les DOT des États de tout le pays possèdent d'énormes bibliothèques de documentation technique constituées sur des décennies, presque toutes stockées sous forme de PDF statiques sans possibilité de recherche électronique, un problème de trouvabilité que le WSDOT partageait avec les agences de transport de tout le pays plutôt qu'un problème propre à l'État de Washington. Cette nature partagée est précisément la raison pour laquelle le NCHRP, financé de manière coopérative par tous les DOT d'État, a parrainé ce travail comme une recherche généralisable plutôt qu'un correctif ponctuel : tout cadre et toute méthodologie développés devaient pouvoir être répliqués par les autres agences de transport d'État confrontées au même défi, et pas seulement être utilisables par le seul WSDOT.
Situation de départ
Le NCHRP et le WSDOT ont retenu ensemble, comme objet de la recherche, les manuels de référence d'ingénierie que les ingénieurs des États utilisent pour planifier et exécuter les projets d'infrastructure. Les objectifs du projet conjoint étaient de définir un cadre pour la classification, la recherche et la restitution de l'information de transport, et de décrire des pratiques éprouvées pour organiser et classifier le contenu des DOT. Le projet visait également à développer des procédures de recherche d'entreprise et de recherche fédérée qu'un DOT pourrait utiliser pour rendre son information plus accessible, et à préparer un système pilote démontrant les concepts de trouvabilité améliorée pour les données du DOT d'un État. Iknow et Spy Pond Partners, un cabinet de conseil en management basé à Boston et spécialisé dans le secteur des transports, ont été sélectionnés pour réaliser les travaux.
Problème / défi
- Une immense bibliothèque technique non interrogeable. Les 60 manuels de référence d'ingénierie du WSDOT n'existaient que sous forme de PDF statiques sans recherche électronique, obligeant les ingénieurs à faire défiler manuellement les documents pour localiser des orientations techniques critiques.
- Aucune structure existante de classification ou de restitution. Le contenu ne disposait d'aucune taxonomie, ontologie ou couche de métadonnées ; un moteur de recherche ne pouvait orienter l'utilisateur vers une réponse précise sans comprendre d'abord de quoi traitait réellement chaque section de texte.
- Une solution généralisable était exigée, pas un correctif ponctuel. La recherche étant financée de manière coopérative par tous les DOT d'État via le NCHRP, le pilote devait démontrer un cadre réplicable que d'autres États pourraient adopter, et non un simple outil sur mesure réservé au WSDOT.
- Un contenu hautement technique et propre au domaine. Les manuels couvrant l'hydraulique, la gestion des eaux pluviales, la conformité environnementale et la conception des abords routiers utilisaient un vocabulaire d'ingénierie précis et spécialisé qu'un moteur de recherche générique ou un outil de classification standard ne comprendrait pas de manière fiable.
Objectifs du projet
- Définir un cadre pour la classification, la recherche et la restitution de l'information de transport.
- Décrire des pratiques éprouvées pour organiser et classifier le contenu des DOT.
- Développer des procédures de recherche d'entreprise et de recherche fédérée qu'un DOT pourrait utiliser pour rendre son information de transport plus facilement accessible aux utilisateurs.
- Préparer un système pilote démontrant les concepts de trouvabilité améliorée pour les données du DOT d'un État.
L’approche d’Iknow
Comment Iknow a structuré la mission
Iknow a appliqué un processus en quatre étapes (préparer, analyser, décrire et catégoriser) à un corpus défini de huit manuels du WSDOT contenant des contenus liés aux eaux pluviales, totalisant plus de 5 000 pages de texte jusque-là non interrogeable.
Activités et décisions clés
- Préparer. Iknow a déconstruit les huit manuels en sections et sous-sections (des fichiers texte ou HTML plus petits, chacun couvrant un seul sujet) afin que le moteur de recherche puisse orienter les utilisateurs exactement au bon endroit d'un manuel technique. Iknow a ensuite supprimé trois types de bruit (mots vides, textes standardisés et expressions sans valeur ajoutée comme la table des matières) avant l'analyse.
- Analyser. Iknow a appliqué la fouille de texte pour identifier et dénombrer les mots-clés et expressions nécessaires aux modèles sémantiques d'autocatégorisation et à un thésaurus de projet, ainsi qu'une analyse par grappes pour regrouper les données textuelles en classes conceptuellement significatives pouvant être organisées hiérarchiquement pour la navigation.
- Décrire. Sur la base des résultats de la fouille de texte et de l'analyse par grappes, Iknow a retenu trois facettes indépendantes pour le pilote : l'actif (par exemple, un ponceau), la liste maîtresse des livrables (une hiérarchie de processus, groupes de travail, jalons et livrables) et les meilleures pratiques de gestion pour la gestion et le traitement des eaux pluviales.
- Catégoriser. Iknow a construit une ontologie pour chaque facette : une ontologie des ponceaux issue du WSDOT Hydraulics Manual, de la FHWA Hydraulic Design Series No. 5 et de l'Engineering Publications Thesaurus du WSDOT, avec quatre branches couvrant les formes, les pièces, les matériaux et les traitements d'extrémité ; une ontologie de la liste maîtresse des livrables construite directement dans l'éditeur open source Protégé avec des relations de termes de type et d'équivalence ; et une ontologie des BMP eaux pluviales issue du Temporary Erosion and Sediment Control Manual et du Highway Runoff Manual du WSDOT ainsi que du Stormwater Manual for Western Washington du département de l'Écologie de l'État de Washington.
- Mise en œuvre technique. Iknow a assemblé une architecture composée des meilleurs outils de chaque catégorie, combinant Drupal (avec le module Drupal Books pour ingérer et présenter les manuels tout en préservant leur structure d'origine), Apache Solr pour la recherche et MySQL pour le stockage des contenus. L'architecture était complétée par Protégé pour la création d'ontologies, Apache Jena pour rapprocher le contenu de l'ontologie et stocker les résultats sous forme de triplets, Google NLP pour la lemmatisation et l'extraction d'entités, et Taggr, une application propriétaire d'Iknow construite spécifiquement pour appliquer les étiquettes identifiées par Jena à la bonne section de contenu dans Drupal. Le pilote résultant offrait un filtrage à facettes par manuel, actif et livrable maître, des résultats classés par pertinence avec extraits de texte surlignés, et des pages de contenu intégral préservant la navigation par table des matières d'origine de chaque manuel.
Parties prenantes et collaboration
Iknow est intervenu comme sous-traitant du contractant principal Spy Pond Partners, en livrant le chantier du système pilote au sein du projet de recherche plus large NCHRP/WSDOT, sous la supervision du NCHRP et du Transportation Research Board.
Les défis et comment Iknow les a surmontés
Apprendre à un moteur de recherche à comprendre un langage d'ingénierie hautement technique
Les outils génériques de recherche et de classification ne sont pas conçus pour comprendre de manière fiable un vocabulaire d'ingénierie précis et propre au domaine, couvrant l'hydraulique, la gestion des eaux pluviales et la conception des abords routiers. Iknow y a répondu en construisant des ontologies spécifiques à l'usage, ancrées directement dans les manuels de référence faisant autorité du WSDOT et dans les normes eaux pluviales de la FHWA et de l'État, plutôt que dans un thésaurus générique, et en combinant une classification sémantique à base de règles avec une classification par apprentissage automatique par l'exemple, afin que le système applique une structure définie par des experts tout en continuant à s'améliorer à l'usage.
Assembler une chaîne fiable à partir de six outils indépendants
La solution technique reposait sur six outils distincts, open source et propriétaires (Protégé, Apache Jena, Google NLP, Drupal, Apache Solr et MySQL), chacun devant passer proprement le relais au suivant sans rompre la chaîne allant du texte brut au contenu balisé et interrogeable. Iknow y a répondu en concevant et documentant un schéma de processus explicite de bout en bout reliant chaque outil, et en construisant Taggr spécifiquement pour résoudre le seul maillon manquant de cette chaîne : réappliquer les étiquettes de métadonnées identifiées par Jena à la section de contenu exacte et correcte dans Drupal.
Résultats et impact
Résultats opérationnels
- Traitement de huit manuels d'ingénierie du WSDOT totalisant plus de 5 000 pages de contenu PDF jusque-là non interrogeable.
- Construction de trois facettes taxonomiques indépendantes (actif, liste maîtresse des livrables et meilleures pratiques de gestion) et de trois ontologies correspondantes ancrées dans les normes techniques du WSDOT et de la FHWA elles-mêmes.
- Intégration de six produits logiciels distincts, open source et propriétaires, dont l'application Taggr propre à Iknow, en une chaîne pilote opérationnelle unique.
Résultats stratégiques et organisationnels
Le système pilote a confirmé que la trouvabilité pouvait être améliorée de manière significative en analysant la teneur thématique d'un corpus de contenu, en appliquant des métadonnées descriptives précises et en automatisant la classification par une combinaison de règles sémantiques et d'apprentissage automatique. Il a livré une expérience de recherche à facettes, navigable et classée par pertinence, qui préservait la logique organisationnelle d'origine de chaque manuel tout en rendant son contenu découvrable pour la première fois. En tant que projet de recherche NCHRP financé de manière coopérative, le cadre résultant a été conçu pour être généralisable et mis à la disposition des autres DOT d'État confrontés au même défi documentaire. Le projet pilote a ensuite guidé les efforts ultérieurs du WSDOT pour améliorer la trouvabilité et la découvrabilité de son contenu technique.
Délai avant impact
Iknow a livré une application pilote pleinement fonctionnelle et démontrable dans le cadre de la mission de cinq mois, un délai rapide pour un projet couvrant la déconstruction du corpus, la conception d'ontologies et l'intégration de six technologies distinctes en un seul système opérationnel.
Les capacités d’Iknow démontrées
Compétences clés
- Analyse de texte et classification de contenu
- Conception de taxonomies et d'ontologies
- Mise en œuvre de recherche d'entreprise
- Développement logiciel sur mesure
Méthodes et cadres
- Fouille de texte et analyse par grappes
- Classification sémantique à base de règles combinée à une classification par apprentissage automatique par l'exemple
- Conception de recherche et de navigation à facettes
- Méthodologie de déconstruction de corpus et de découpage de contenu
Technologies et outils
- Protégé (création d'ontologies)
- Apache Jena (rapprochement d'ontologies et stockage de triplets)
- Google NLP (lemmatisation et extraction d'entités)
- Drupal, Apache Solr et MySQL (gestion de contenu, recherche et stockage)
- Taggr (application propriétaire d'Iknow d'étiquetage automatique)
Mettez cette expérience au service de votre problème.
Une grande partie de notre travail ne figure jamais sur le site. Réservez un appel, indiquez-nous votre secteur et nous vous présenterons les missions qui correspondent au vôtre.
