Del piloto a producción: construir una ontología impulsada por aprendizaje automático para el contenido de ingeniería de WSDOT.
Departamento de Transporte, Estado de Washington · Sector público
Aplicar minería de texto, análisis de conglomerados y diseño de ontologías para unificar 18 manuales de ingeniería de transporte

Resumen ejecutivo
Sobre la base de los conceptos de encontrabilidad validados en un proyecto piloto anterior patrocinado por el NCHRP, el Departamento de Transporte del Estado de Washington (WSDOT) contrató a Iknow, a través del contratista principal Spy Pond Partners, para una iniciativa más amplia: desarrollar una ontología de transporte de producción centrada en la evacuación de aguas pluviales de las carreteras. El objetivo del WSDOT era habilitar la búsqueda y la navegación a través de manuales de ingeniería con contenido específico sobre hidrología, erosión, diseño de carreteras, gestión de la escorrentía vial, aspectos ambientales, estimación de costos, política de márgenes viales, mantenimiento de carreteras y acomodación de servicios públicos.
Iknow aplicó una metodología rigurosa impulsada por aprendizaje automático, minería de texto y análisis de conglomerados con la biblioteca Scikit-learn de Python, probando tanto el agrupamiento K-means como el modelado de temas con Latent Dirichlet Allocation, para analizar el solapamiento de contenido entre 18 manuales de ingeniería del WSDOT. Tras validar el conjunto de términos resultante con expertos en la materia, Iknow construyó manualmente una ontología de siete clases con WebProtégé, capturando tipos de relaciones ricos que van mucho más allá de una simple jerarquía, y luego ingirió la ontología en un sistema de autoclasificación y clasificó el corpus completo de contenido de ingeniería. El resultado fue una ontología de aguas pluviales robusta y de producción que los usuarios del WSDOT encontraron genuinamente beneficiosa al buscar información, demostrando el concepto del piloto subyacente a una escala operativa real.
Antecedentes y contexto
Acerca del cliente
El WSDOT publica decenas de manuales de referencia de ingeniería en los que los ingenieros del estado se apoyan para planificar y ejecutar proyectos de infraestructura de transporte, abarcando temas que van desde la hidráulica y el cumplimiento ambiental hasta el diseño de márgenes viales y el mantenimiento de carreteras. Este proyecto dio continuidad al trabajo de encontrabilidad que Iknow había iniciado para el WSDOT mediante un proyecto piloto anterior, patrocinado por el NCHRP, centrado en un conjunto más reducido de manuales relacionados con aguas pluviales.
Contexto del sector
Este proyecto representa una evolución natural de aquel piloto anterior, pasando de una prueba de concepto focalizada a una aplicación de mayor escala que abarca 18 manuales e incorpora técnicas de aprendizaje automático más sofisticadas, agrupamiento no supervisado y modelado de temas, en lugar de depender principalmente del análisis manual. La distinción entre una taxonomía y una ontología es importante aquí. Una taxonomía captura relaciones jerárquicas simples de tipo padre-hijo, del estilo «tipo de» o «es un», mientras que una ontología puede capturar tipos de relaciones mucho más ricos, como la composición de materiales, la estructura parte-todo y las relaciones de proceso o de ciclo de vida. Esto brinda a los usuarios de ingeniería una forma genuinamente más potente de entender y navegar cómo se relacionan los conceptos entre sí, y no solo dónde se ubican en una jerarquía.
Situación actual
Como parte de un proyecto del WSDOT para mejorar la gestión y la encontrabilidad del contenido de ingeniería de transporte, Iknow desarrolló una ontología de transporte centrada en la evacuación de aguas pluviales de las carreteras. La ontología de aguas pluviales permitió al equipo demostrar el concepto de que una ontología podía clasificar y documentar las relaciones entre conceptos y, a la vez, usarse para impulsar la autoclasificación del contenido de ingeniería.
Problema / desafío
- Un corpus de contenido mucho más grande y complejo que el abordado en el piloto anterior. Era necesario analizar en conjunto 18 manuales de ingeniería distintos, cada uno redactado y mantenido de forma independiente, para revelar cuánto solapamiento temático genuino existía entre ellos, información con la que el WSDOT no contaba al inicio.
- Una taxonomía simple no podía capturar la complejidad real de las relaciones de ingeniería. Conceptos como las alcantarillas involucran simultáneamente composición de materiales, tratamientos de extremos, estructura parte-todo y pertenencia a sistemas, relaciones que una jerarquía básica padre-hijo no puede representar, pero con las que los ingenieros realmente necesitan buscar y razonar.
- Sin evidencia cuantitativa previa de cuánto se solapaba realmente el contenido de los manuales. El WSDOT necesitaba evidencia objetiva y defendible, no solo una suposición, de que consolidar el contenido clasificado de los 18 manuales ayudaría genuinamente a los usuarios antes de invertir más en el enfoque.
- Preparar contenido fuente genuinamente desordenado para un análisis riguroso de aprendizaje automático. Los manuales de ingeniería existían como archivos PDF, lo que exigía su conversión a texto y un preprocesamiento extenso antes de poder iniciar cualquier minería de texto o agrupamiento significativos.
Objetivos del proyecto
- Desarrollar una ontología de transporte centrada en la evacuación de aguas pluviales de las carreteras.
- Habilitar la búsqueda y la navegación a través de los manuales de ingeniería del WSDOT que cubren hidrología, erosión, diseño de carreteras, escorrentía vial, aspectos ambientales, estimación de costos, política de márgenes viales, mantenimiento de carreteras y acomodación de servicios públicos.
- Demostrar el concepto de que una ontología podía tanto clasificar y documentar las relaciones entre conceptos como impulsar la autoclasificación del contenido de ingeniería.
El enfoque de Iknow
Cómo estructuró Iknow el trabajo
Iknow siguió un proceso de ocho pasos que combinó un análisis riguroso de contenido basado en aprendizaje automático, la validación con expertos en la materia y la construcción manual de la ontología, seguidos de la ingestión en un sistema de autoclasificación.
Actividades y decisiones clave
- Análisis de contenido. Iknow convirtió los manuales de PDF a texto y realizó el preprocesamiento, tokenización, eliminación de puntuación y de palabras vacías, y stemming, y luego representó numéricamente el texto no estructurado mediante enfoques de bag-of-words y tf-idf, ponderando la frecuencia de los términos frente a cuán comúnmente aparecía un término en el conjunto de los documentos. Utilizando la biblioteca Scikit-learn de Python, Iknow probó dos modelos de aprendizaje automático no supervisado: el agrupamiento K-means, que asigna cada documento a un único conglomerado y puede evaluarse con una métrica de silueta para medir la calidad del ajuste de los conglomerados, y el modelado de temas con Latent Dirichlet Allocation, que asigna a cada documento una distribución de probabilidad entre múltiples temas en lugar de una única asignación rígida a un conglomerado.
- Análisis de resultados. Los resultados del agrupamiento demostraron un solapamiento significativo en el contenido presentado en los 18 manuales analizados, visualizado en un gráfico de distribución de temas entre manuales, respaldando directamente el argumento de que un cuerpo de contenido de ingeniería consolidado y clasificado de forma interactiva ayudaría a los usuarios a descubrir material relacionado en manuales en los que quizá no pensarían buscar.
- Entrevistas con expertos en la materia. Iknow entrevistó a expertos en la materia para confirmar su comprensión de los términos y sinónimos, recabar comentarios sobre el conjunto de términos derivado del aprendizaje automático y agregar, corregir o eliminar términos ambiguos con base en esa aportación experta.
- Selección de términos y autoría de la ontología. Iknow seleccionó los términos finales usados para describir el contenido y las relaciones entre los términos, utilizando WebProtégé como herramienta de autoría de la ontología.
- Desarrollo de la ontología. Iknow construyó manualmente la ontología en torno a siete clases relacionadas que representan los datos que requieren los usuarios de ingeniería, Drainage Assets, Best Management Practices, Master Deliverables, Practical Solutions Life Cycle, Drainage System, Materials y Project Development Topic Areas, capturando tipos de relaciones que van mucho más allá de la simple jerarquía, incluidas relaciones de composición de materiales, tratamiento de extremos, parte-todo, sistema-elemento, pasos de trabajo del ciclo de vida y entregable-tema.
- Ingestión y clasificación. Iknow ingirió la ontología terminada en el sistema de autoclasificación y clasificó con base en ella el corpus completo de contenido de ingeniería de transporte.
Partes interesadas y colaboración
Iknow trabajó como subcontratista del contratista principal Spy Pond Partners, colaborando directamente con los expertos en la materia del WSDOT para validar la terminología y confirmar que las relaciones de la ontología reflejaban la práctica real de la ingeniería.
Desafíos y cómo Iknow los superó
Demostrar el solapamiento de contenido con evidencia, no con suposiciones
Consolidar el contenido clasificado de 18 manuales mantenidos de forma independiente solo valía la pena si existía un solapamiento temático real entre ellos, y el WSDOT necesitaba pruebas antes de comprometerse más. Iknow lo abordó aplicando un análisis riguroso y cuantitativo de aprendizaje automático, tanto agrupamiento K-means como modelado de temas LDA mediante Scikit-learn, sobre el corpus completo, produciendo un análisis objetivo de distribución de temas entre manuales que demostró directamente un solapamiento significativo de contenido, convirtiendo una hipótesis plausible en un hallazgo defendible y basado en evidencia antes de comenzar cualquier construcción de la ontología.
Capturar relaciones que una taxonomía estándar no podía representar
Los conceptos de ingeniería como las alcantarillas tienen múltiples atributos simultáneos, material, estructura, función, pertenencia a sistemas, que una taxonomía plana padre-hijo no puede representar. Iknow lo abordó construyendo una verdadera ontología en lugar de una taxonomía, definiendo siete tipos de relaciones distintos y creados con un propósito específico, de modo que los conceptos pudieran representarse con toda la riqueza de sus atributos reales de ingeniería, y no solo con una única posición en una jerarquía.
Resultados e impacto
Resultados operativos
- Se analizó el contenido de 18 manuales de ingeniería del WSDOT mediante minería de texto y análisis de conglomerados, probando dos modelos distintos de aprendizaje automático no supervisado.
- Se construyó una ontología de siete clases, Drainage Assets, Best Management Practices, Master Deliverables, Practical Solutions Life Cycle, Drainage System, Materials y Project Development Topic Areas, definiendo siete tipos de relaciones distintos más allá de la simple jerarquía padre-hijo.
- Se ingirió la ontología en el sistema de autoclasificación del WSDOT y se clasificó el corpus completo de contenido de ingeniería.
Resultados estratégicos y organizacionales
El análisis de conglomerados demostró un solapamiento temático significativo en el contenido de los 18 manuales, validando el argumento a favor de un cuerpo de contenido de ingeniería consolidado y clasificado de forma interactiva. Los usuarios encontraron las etiquetas y relaciones resultantes genuinamente beneficiosas para su trabajo, específicamente al buscar información, demostrando el concepto subyacente del piloto anterior de Iknow patrocinado por el NCHRP a plena escala de producción, en una implementación mucho más grande y técnicamente más sofisticada.
Tiempo hasta el impacto
El proyecto de Iknow se extendió por aproximadamente 20 meses, reflejando la profundidad técnica del trabajo, desde el análisis riguroso del corpus basado en aprendizaje automático, pasando por la construcción manual de la ontología, hasta la ingestión y clasificación completas en producción, y representando una evolución de varios años del programa de encontrabilidad del WSDOT que comenzó con el piloto anterior del NCHRP.
Capacidades de Iknow demostradas
Competencias principales
- Diseño y desarrollo de ontologías
- Análisis de contenido basado en aprendizaje automático
- Implementación de autoclasificación
- Taxonomías y modelado del conocimiento
Métodos y marcos de trabajo
- Minería de texto y análisis de conglomerados (K-means, Latent Dirichlet Allocation)
- Representación de texto con tf-idf y bag-of-words
- Desarrollo de términos validado por expertos en la materia
- Modelado de ontologías ricas en relaciones
Tecnologías y herramientas
- Python (Scikit-learn, NumPy, SciPy)
- WebProtégé (autoría de ontologías)
- Sistemas de autoclasificación
Casos de estudio relacionados
Ponga esta experiencia a trabajar en su problema.
Gran parte de nuestro trabajo nunca llega a la web. Reserve una llamada, cuéntenos su sector y le mostraremos los proyectos que corresponden al suyo.
