Hacer encontrables 5,000 páginas de manuales de ingeniería: un piloto de búsqueda semántica para los DOT estatales.
National Cooperative Highway Research Program, Transportation Research Board, National Academies of Sciences Engineering and Medicine, and the Department of Transportation, State of Washington · Sector público
Analítica de texto, diseño de ontologías y autoclasificación para los manuales de referencia de ingeniería de WSDOT

Resumen ejecutivo
El National Cooperative Highway Research Program (NCHRP) y el Departamento de Transporte del Estado de Washington (WSDOT) patrocinaron conjuntamente un proyecto de investigación para resolver un problema familiar para los organismos estatales de transporte de todo el país. Solo el WSDOT publica 60 manuales de referencia de ingeniería en los que los ingenieros estatales se apoyan para planificar y ejecutar proyectos de infraestructura, todos en formato PDF estándar y sin capacidad de búsqueda electrónica. Los ingenieros tenían que desplazarse manualmente por los PDF para encontrar la orientación técnica que necesitaban.
Iknow, trabajando como subcontratista del contratista principal Spy Pond Partners, construyó el sistema piloto del proyecto, transformando ocho manuales del WSDOT relacionados con aguas pluviales, con un total de más de 5.000 páginas de texto sin capacidad de búsqueda, en una aplicación de búsqueda por facetas impulsada por ontologías. Mediante un proceso de cuatro pasos que abarcaba la minería de texto, el diseño de ontologías y la clasificación automatizada, Iknow integró seis herramientas de software de código abierto y propietarias en un piloto operativo que demostró cómo el análisis de texto, la autoclasificación y el aprendizaje automático podían hacer que miles de páginas de contenido técnico fueran genuinamente encontrables, moldeando directamente la posterior estrategia de encontrabilidad del WSDOT.
Antecedentes y contexto
Sobre el cliente
El NCHRP fue creado en 1962 por la American Association of State Highway and Transportation Officials (AASHTO) como un programa nacional de investigación financiado cooperativamente para abordar problemas comunes a los departamentos estatales de transporte. Lo administra el Transportation Research Board, parte de las National Academies of Sciences, Engineering, and Medicine, en cooperación con la Federal Highway Administration, y se financia con las aportaciones de todos los DOT estatales. El WSDOT, uno de los organismos estatales patrocinadores del NCHRP, publica 60 manuales de referencia de ingeniería que cubren desde la hidráulica hasta el cumplimiento ambiental y en los que sus ingenieros se apoyan a diario.
Contexto del sector
Los DOT estatales de todo el país acumulan enormes bibliotecas de documentación técnica construidas a lo largo de décadas, almacenadas casi universalmente como PDF estáticos sin capacidad de búsqueda electrónica, un problema de encontrabilidad que el WSDOT compartía con los organismos de transporte de todo el país y que no era exclusivo del Estado de Washington. Esa naturaleza compartida es precisamente la razón por la que el NCHRP, financiado cooperativamente por todos los DOT estatales, patrocinó esto como investigación generalizable y no como una solución puntual: cualquier marco y metodología desarrollados debían poder ser replicados por otros organismos estatales de transporte que afrontaran el mismo reto, no solo utilizables por el WSDOT.
Situación de partida
El NCHRP y el WSDOT seleccionaron conjuntamente como foco de la investigación los manuales de referencia de ingeniería que los ingenieros estatales utilizan para planificar y ejecutar proyectos de infraestructura. Los objetivos del proyecto conjunto eran definir un marco para la clasificación, búsqueda y recuperación de información de transporte y describir prácticas de éxito para organizar y clasificar el contenido de los DOT. El proyecto también pretendía desarrollar procedimientos de búsqueda empresarial y federada que un DOT pudiera utilizar para hacer su información más accesible, y preparar un sistema piloto que demostrara los conceptos de encontrabilidad mejorada para los datos del DOT de un estado. Iknow y Spy Pond Partners, una consultora de gestión con sede en Boston centrada en el sector del transporte, fueron seleccionadas para realizar el trabajo.
Problema / desafío
- Una biblioteca técnica enorme y sin capacidad de búsqueda. Los 60 manuales de referencia de ingeniería del WSDOT existían solo como PDF estáticos sin capacidad de búsqueda electrónica, obligando a los ingenieros a desplazarse manualmente por los documentos para localizar orientación técnica crítica.
- Ninguna estructura existente para la clasificación o la recuperación. El contenido carecía de taxonomía, ontología o capa de metadatos; un motor de búsqueda no podía dirigir al usuario a una respuesta precisa sin entender primero de qué trataba realmente cada sección de texto.
- Se requería una solución generalizable, no un arreglo puntual. Como la investigación estaba financiada cooperativamente por todos los DOT estatales a través del NCHRP, el piloto debía demostrar un marco replicable que otros estados pudieran adoptar, no solo una herramienta a medida para el WSDOT.
- Contenido altamente técnico y específico del dominio. Los manuales sobre hidráulica, gestión de aguas pluviales, cumplimiento ambiental y diseño de márgenes de carretera empleaban un vocabulario de ingeniería preciso y especializado que un motor de búsqueda genérico o una herramienta de clasificación estándar no entendería de forma fiable.
Objetivos del proyecto
- Definir un marco para la clasificación, búsqueda y recuperación de información de transporte.
- Describir prácticas de éxito para organizar y clasificar el contenido de los DOT.
- Desarrollar procedimientos de búsqueda empresarial y búsqueda federada que un DOT pudiera utilizar para hacer su información de transporte más fácilmente accesible para los usuarios.
- Preparar un sistema piloto que demostrara los conceptos de encontrabilidad mejorada para los datos del DOT de un estado.
El enfoque de Iknow
Cómo estructuró Iknow el trabajo
Iknow aplicó un proceso de cuatro pasos (Preparar, Analizar, Describir y Categorizar) a un corpus definido de ocho manuales del WSDOT con contenido relacionado con aguas pluviales, con un total de más de 5.000 páginas de texto hasta entonces sin capacidad de búsqueda.
Actividades y decisiones clave
- Preparar. Iknow descompuso los ocho manuales en secciones y subsecciones (archivos de texto o HTML más pequeños, cada uno dedicado a un solo tema) para que el motor de búsqueda pudiera dirigir a los usuarios exactamente al lugar correcto de un manual técnico. A continuación, Iknow eliminó tres tipos de ruido (palabras vacías, texto repetitivo y frases sin valor añadido como el índice de contenidos) antes del análisis.
- Analizar. Iknow aplicó minería de texto para identificar y contar las palabras clave y frases necesarias para los modelos semánticos de autocategorización y un tesauro del proyecto, y análisis de clústeres para agrupar los datos textuales en clases conceptualmente significativas que pudieran organizarse jerárquicamente para la navegación.
- Describir. A partir de los resultados de la minería de texto y del análisis de clústeres, Iknow seleccionó tres facetas independientes para el piloto: Activo (por ejemplo, alcantarilla), la Lista Maestra de Entregables (una jerarquía de procesos, grupos de trabajo, hitos y entregables) y las mejores prácticas de gestión para la gestión y el tratamiento de aguas pluviales.
- Categorizar. Iknow construyó una ontología para cada faceta: una ontología de alcantarillas derivada del WSDOT Hydraulics Manual, de la FHWA Hydraulic Design Series No. 5 y del Engineering Publications Thesaurus del WSDOT, con cuatro ramas que cubrían formas, partes, materiales y tratamientos de extremos; una ontología de la Lista Maestra de Entregables construida directamente en el editor de código abierto Protégé con relaciones de términos de tipo y de equivalencia; y una ontología de BMP de aguas pluviales derivada del Temporary Erosion and Sediment Control Manual y del Highway Runoff Manual del WSDOT y del Stormwater Manual for Western Washington del Departamento de Ecología del Estado de Washington.
- Implementación técnica. Iknow ensambló una arquitectura con lo mejor de cada categoría combinando Drupal (utilizando el módulo Drupal Books para ingerir y presentar los manuales conservando su estructura original), Apache Solr para la búsqueda y MySQL para el almacenamiento de contenidos. La arquitectura se completó con Protégé para la autoría de ontologías, Apache Jena para cotejar el contenido con la ontología y almacenar los resultados como tripletas, Google NLP para la lematización y la extracción de entidades, y Taggr, una aplicación propietaria de Iknow construida específicamente para aplicar las etiquetas identificadas por Jena a la sección correcta del contenido dentro de Drupal. El piloto resultante ofrecía filtrado por facetas por manual, activo y entregable maestro, resultados ordenados por relevancia con fragmentos de texto resaltados y páginas de contenido completo que conservaban la navegación por el índice original de cada manual.
Partes interesadas y colaboración
Iknow trabajó como subcontratista del contratista principal Spy Pond Partners, entregando la línea de trabajo del sistema piloto dentro del proyecto de investigación más amplio del NCHRP y el WSDOT, bajo la supervisión del NCHRP y del Transportation Research Board.
Desafíos y cómo Iknow los superó
Enseñar a un motor de búsqueda a entender un lenguaje de ingeniería altamente técnico
Las herramientas genéricas de búsqueda y clasificación no están construidas para entender de forma fiable un vocabulario de ingeniería preciso y específico del dominio que abarca la hidráulica, la gestión de aguas pluviales y el diseño de márgenes de carretera. Iknow lo resolvió construyendo ontologías específicas para el propósito, cimentadas directamente en los propios manuales de referencia autorizados del WSDOT y en los estándares de aguas pluviales de la FHWA y del estado, en lugar de en un tesauro genérico, y combinando la clasificación semántica basada en reglas con la clasificación por aprendizaje automático mediante ejemplos, de modo que el sistema pudiera aplicar la estructura definida por expertos sin dejar de mejorar con el uso.
Ensamblar un flujo fiable a partir de seis herramientas independientes
La solución técnica dependía de seis herramientas separadas, de código abierto y propietarias (Protégé, Apache Jena, Google NLP, Drupal, Apache Solr y MySQL), cada una de las cuales debía pasar el testigo limpiamente a la siguiente sin romper la cadena que va del texto en bruto al contenido etiquetado y con capacidad de búsqueda. Iknow lo abordó diseñando y documentando un esquema explícito del proceso de extremo a extremo que conectaba todas las herramientas, y construyendo Taggr específicamente para resolver el único eslabón que faltaba en esa cadena: aplicar las etiquetas de metadatos identificadas por Jena de vuelta a la sección exacta y correcta del contenido dentro de Drupal.
Resultados e impacto
Resultados operativos
- Procesamiento de ocho manuales de ingeniería del WSDOT con un total de más de 5.000 páginas de contenido PDF hasta entonces sin capacidad de búsqueda.
- Construcción de tres facetas de taxonomía independientes (Activo, Lista Maestra de Entregables y mejores prácticas de gestión) y de tres ontologías correspondientes cimentadas en los propios estándares técnicos del WSDOT y de la FHWA.
- Integración de seis productos de software distintos, de código abierto y propietarios, incluida la propia aplicación Taggr de Iknow, en un único flujo piloto operativo.
Resultados estratégicos y organizativos
El sistema piloto confirmó que la encontrabilidad podía mejorarse de forma significativa analizando el contenido temático de un corpus, aplicando metadatos descriptivos precisos y automatizando la clasificación mediante una combinación de reglas semánticas y aprendizaje automático. Ofreció una experiencia de búsqueda por facetas, navegable y ordenada por relevancia que conservaba la lógica organizativa original de cada manual al tiempo que hacía su contenido descubrible por primera vez. Además, al tratarse de un proyecto de investigación del NCHRP financiado cooperativamente, el marco resultante se diseñó para ser generalizable y estar disponible para otros DOT estatales que afrontan el mismo reto documental. El proyecto piloto pasó a orientar los esfuerzos futuros del WSDOT para mejorar la encontrabilidad y descubribilidad de su contenido técnico.
Plazo hasta el impacto
Iknow entregó una aplicación piloto plenamente funcional y demostrable dentro del proyecto de cinco meses, un plazo rápido para un trabajo que abarcaba la descomposición del corpus, el diseño de ontologías y la integración de seis tecnologías separadas en un único sistema operativo.
Capacidades de Iknow demostradas
Competencias clave
- Análisis de texto y clasificación de contenidos
- Diseño de taxonomías y ontologías
- Implantación de búsqueda empresarial
- Desarrollo de software a medida
Métodos y marcos
- Minería de texto y análisis de clústeres
- Clasificación semántica basada en reglas combinada con clasificación por aprendizaje automático mediante ejemplos
- Diseño de búsqueda y navegación por facetas
- Metodología de descomposición de corpus y segmentación de contenidos
Tecnologías y herramientas
- Protégé (autoría de ontologías)
- Apache Jena (cotejo de ontologías y almacenamiento de tripletas)
- Google NLP (lematización y extracción de entidades)
- Drupal, Apache Solr y MySQL (gestión de contenidos, búsqueda y almacenamiento)
- Taggr (aplicación propietaria de Iknow para etiquetado automático)
Casos de estudio relacionados
Ponga esta experiencia a trabajar en su problema.
Gran parte de nuestro trabajo nunca llega a la web. Reserve una llamada, cuéntenos su sector y le mostraremos los proyectos que corresponden al suyo.
