Saltar al contenido
Iknow

Enseñar a una ontología a leer documentos de ingeniería vial: una plataforma semántica de metadatos con AI para el DOT del estado de Washington.

National Cooperative Highway Research Program, Transportation Research Board, National Academies of Sciences Engineering and Medicine · Sector público

Automatizar la clasificación de contenidos y la búsqueda para la base de conocimiento de ingeniería de una agencia estatal de transporte

Resumen ejecutivo

El Departamento de Transporte del Estado de Washington (WSDOT) gestiona uno de los mayores sistemas de carreteras estatales del país, y sus ingenieros dependen de una biblioteca en constante crecimiento de manuales de diseño, especificaciones estándar e informes técnicos para hacer su trabajo de forma segura y consistente. Como parte de una iniciativa nacional de investigación patrocinada por el National Cooperative Highway Research Program (NCHRP) para mejorar la encontrabilidad de la información en las agencias estatales de transporte, WSDOT se propuso demostrar que aplicar metadatos automatizados a su contenido de ingeniería podía mejorar de forma medible la navegación y la precisión y exhaustividad de la búsqueda. Iknow, trabajando como subcontratista del contratista principal de investigación Spy Pond Partners, fue contratada para diseñar e integrar la plataforma tecnológica que lo hiciera posible.

Iknow construyó una plataforma de IA semántica de siete componentes (anclada en una ontología construida a medida, un almacén de tripletas al estilo de un grafo de conocimiento y una cadena de procesamiento de lenguaje natural) que leía, interpretaba y etiquetaba automáticamente los documentos de ingeniería de WSDOT, y luego entregaba esos metadatos a un motor de búsqueda empresarial moderno. La plataforma clasificó correctamente más de 2,000 documentos a lo largo de múltiples rondas de pruebas, y los ingenieros de WSDOT confirmaron que los resultados cumplían sus expectativas de precisión. La metodología y los resultados quedaron documentados en el NCHRP Research Report 947, dando a los demás DOT estatales un modelo probado y replicable para el mismo problema de encontrabilidad.

Antecedentes y contexto

Acerca del cliente

WSDOT es la agencia estatal responsable de construir, mantener y operar el sistema de transporte multimodal de Washington, incluidas sus carreteras, sus transbordadores y sus corredores ferroviarios. El departamento es responsable de más de 20,000 millas-carril de calzada y de casi 3,000 puentes vehiculares, y opera con un presupuesto bienal que supera los $11 mil millones. Una agencia de esa escala genera un cuerpo de conocimiento de ingeniería en continua expansión (manuales de diseño, especificaciones, documentación ambiental y registros de proyectos) que los ingenieros deben poder encontrar rápidamente y en el que deben poder confiar plenamente.

Contexto del sector

Los departamentos estatales de transporte comparten un desafío común: se cuentan entre las organizaciones de ingeniería con mayor volumen documental del gobierno, y sin embargo la mayoría se construyó sobre sistemas de contenido diseñados para el almacenamiento y el control de versiones, no para ayudar a los ingenieros a encontrar el concepto correcto dentro de miles de documentos técnicos. El NCHRP, un programa nacional de investigación mancomunada financiado por los DOT estatales y administrado a través de AASHTO y el Transportation Research Board, ya había publicado el NCHRP Report 846, Improving Findability and Relevance of Transportation Information, que exponía el problema. El proyecto de WSDOT con Iknow y Spy Pond Partners fue la fase aplicada, de integración tecnológica, de esa investigación, documentada más tarde junto a pilotos paralelos de otros DOT estatales en el NCHRP Research Report 947. Las plataformas de contenido comerciales utilizadas por las agencias públicas de infraestructura suelen ser sólidas en almacenamiento y control de versiones, pero pocas incluyen una capa semántica capaz de entender que una alcantarilla es un tipo de activo de drenaje, la brecha que WSDOT pidió a Iknow cerrar.

Situación actual

WSDOT ya utilizaba el sistema de gestión de contenidos Drupal, respaldado por una base de datos MySQL, para almacenar, presentar y gestionar su conocimiento, sus procedimientos y sus especificaciones de ingeniería. Lo que le faltaba era una forma de enriquecer ese contenido con metadatos a nivel de concepto a gran escala, la base necesaria para ir más allá de la búsqueda por palabras clave hacia una precisión y exhaustividad genuinas. WSDOT contrató a Iknow, a través del contratista principal Spy Pond Partners, para integrar software capaz de autoclasificar los documentos de ingeniería a medida que se incorporaban.

Problema / desafío

  • Contenido de ingeniería al que la búsqueda de texto plano no podía servir adecuadamente. La biblioteca de WSDOT basada en Drupal albergaba miles de documentos, pero la búsqueda convencional por palabras clave no podía capturar las relaciones entre conceptos de ingeniería (por ejemplo, que una alcantarilla es un tipo de activo de drenaje), por lo que era fácil pasar por alto resultados relevantes.
  • Sin una forma escalable de aplicar metadatos. Etiquetar manualmente la biblioteca documental existente y en continuo crecimiento de WSDOT con metadatos consistentes y significativos no era realista dadas las restricciones de personal y presupuesto del departamento.
  • Una solución que debía funcionar dentro de los sistemas existentes, no reemplazarlos. Cualquier plataforma debía integrarse con el entorno Drupal y MySQL existente de WSDOT en lugar de exigir un reemplazo costoso y disruptivo, una restricción real para una agencia financiada con fondos públicos.
  • Un enfoque no probado que había que demostrar, no dar por sentado. Como la premisa (que el enriquecimiento del contenido y la clasificación computacional podían mejorar la encontrabilidad) era en sí misma el objeto de la investigación, el proyecto tenía que producir evidencia, no solo un sistema funcional.

Objetivos del proyecto

  • Demostrar que el enriquecimiento del contenido y la clasificación computacional podían mejorar la navegación y la precisión y exhaustividad de la búsqueda.
  • Integrar componentes de software en el entorno Drupal y MySQL existente de WSDOT para autoclasificar los documentos a medida que se incorporaban.
  • Construir una ontología específica del dominio que describiera las relaciones semánticas y léxicas entre los conceptos de ingeniería de WSDOT.
  • Validar la plataforma resultante contra la biblioteca documental de WSDOT y confirmar su precisión con los ingenieros que dependerían de ella.

El enfoque de Iknow

Cómo estructuró Iknow el trabajo

Iknow diseñó e integró una plataforma de procesamiento de metadatos de siete componentes que superponía capacidades de IA semántica sobre el entorno Drupal y MySQL existente de WSDOT en lugar de reemplazarlo, orquestada por un componente de integración construido a medida, Taggr.

Actividades y decisiones clave

  • Desarrollo de la ontología. Utilizando Protégé, una plataforma de código abierto para construir modelos de dominios de conocimiento, Iknow construyó una ontología que describía las relaciones semánticas entre los conceptos de ingeniería de WSDOT, elaborada a partir de una taxonomía de relaciones de clase padre-hijo.
  • Grafo de conocimiento y extracción semántica. Iknow desplegó Apache Jena para aplicar esa ontología al corpus documental de WSDOT, extrayendo relaciones entre conceptos como tripletas semánticas (por ejemplo, que una alcantarilla es un tipo de activo de drenaje) y almacenándolas en un almacén de tripletas concebido para datos semánticos interconectados.
  • Preprocesamiento de lenguaje natural. Iknow incorporó Google Cloud NLP para lematizar el texto de los documentos, puntuar los términos según su relevancia y eliminar palabras de poco valor, produciendo una lista limpia y de alta señal de conceptos por documento.
  • Capa de integración a medida. Iknow construyó Taggr como el tejido conectivo de la plataforma: normalizaba las mayúsculas y minúsculas del texto, enrutaba el contenido al motor de NLP, cotejaba los términos de alta relevancia contra el almacén de tripletas de la ontología y escribía las etiquetas en los formularios de contenido de Drupal de WSDOT.
  • Integración de búsqueda empresarial. Iknow conectó el contenido recién etiquetado con Apache Solr, una plataforma de búsqueda de código abierto, para que los ingenieros pudieran recuperar documentos utilizando las relaciones entre conceptos establecidas por la plataforma.
  • Pruebas de validación. Iknow ejecutó la plataforma contra el corpus documental de WSDOT en múltiples rondas de pruebas, clasificando con éxito más de 2,000 documentos y confirmando los resultados con los ingenieros de WSDOT.

Partes interesadas y colaboración

Iknow trabajó como subcontratista del contratista principal de investigación Spy Pond Partners dentro de un proyecto de investigación patrocinado por el NCHRP y supervisado por AASHTO, coordinándose directamente con el personal de ingeniería y de TI de WSDOT para fundamentar la plataforma en contenido real y validar sus resultados.

Desafíos y cómo Iknow los superó

Introducir IA semántica en un entorno heredado y con recursos limitados

Una pila de tecnología semántica construida desde cero corría el riesgo de ser demasiado costosa y disruptiva para los sistemas y el presupuesto existentes de una agencia pública. Iknow lo abordó construyendo la mayor parte de la plataforma (seis de los siete componentes) sobre software de código abierto disponible gratuitamente, y diseñando Taggr como una capa de integración ligera que funcionaba con el entorno Drupal y MySQL existente de WSDOT en lugar de exigir su reemplazo.

Lograr una precisión genuina en el dominio de la ingeniería

Un modelo de clasificación estándar no entendería el vocabulario de ingeniería específico de WSDOT lo bastante bien como para producir resultados fiables. Iknow lo abordó construyendo a propósito una ontología en torno a los propios conceptos de ingeniería de WSDOT y validando la salida de la plataforma contra la biblioteca documental de WSDOT en múltiples rondas de pruebas con los ingenieros de WSDOT, en lugar de considerar una única pasada de prueba como prueba suficiente.

Resultados e impacto

Resultados cuantitativos

  • Documentos clasificados: más de 2,000 documentos de ingeniería, autoclasificados correctamente a lo largo de múltiples rondas de pruebas.
  • Componentes tecnológicos integrados: siete, incluidas seis herramientas de código abierto y un módulo de integración construido a medida (Taggr).
  • Precisión de la búsqueda: confirmada por los ingenieros de WSDOT como conforme a las expectativas del departamento en precisión y exhaustividad.

Resultados cualitativos

Los ingenieros de WSDOT adquirieron la capacidad de buscar contenido de ingeniería por el concepto subyacente en lugar de por la palabra clave exacta, encontrando, por ejemplo, todos los documentos relacionados con una clase de activo de drenaje incluso cuando los documentos individuales usaban terminología diferente. El grafo de conocimiento impulsado por ontologías que construyó Iknow anticipó un enfoque que desde entonces se ha vuelto corriente, ya que muchas organizaciones persiguen hoy arquitecturas semánticas similares basadas en recuperación utilizando grandes modelos de lenguaje. Al ser el proyecto un piloto de investigación del NCHRP, su metodología y sus resultados quedaron documentados en el NCHRP Research Report 947, publicado para todos los DOT estatales miembros de AASHTO.

Plazo hasta el impacto

Iknow entregó una plataforma validada y funcional dentro del período de ejecución del proyecto de aproximadamente 20 meses, con la precisión confirmada contra el propio contenido y los propios ingenieros de WSDOT antes de que concluyera la investigación. Los hallazgos se publicaron a nivel nacional en 2020, dando a los demás DOT estatales un modelo basado en evidencia para usar de inmediato.

Capacidades de Iknow demostradas

Habilidades principales

  • Estrategia de metadatos y taxonomías
  • IA semántica y desarrollo de ontologías
  • Arquitectura de búsqueda empresarial
  • Integración con sistemas heredados

Métodos y marcos de trabajo

  • Ingeniería de ontologías y grafos de conocimiento
  • Enriquecimiento de contenido basado en NLP
  • Integración de plataformas por fases y pruebas de validación

Tecnologías y herramientas

  • Drupal, MySQL y Protégé
  • Apache Jena, Apache Solr y Google Cloud NLP
  • Módulo de integración Taggr construido a medida

Ponga esta experiencia a trabajar en su problema.

Gran parte de nuestro trabajo nunca llega a la web. Reserve una llamada, cuéntenos su sector y le mostraremos los proyectos que corresponden al suyo.