Aprendizaje automático frente a reglas: una prueba de clasificación cara a cara para el archivo documental del DOT de Utah.
National Cooperative Highway Research Program, Transportation Research Board, National Academies of Sciences Engineering and Medicine · Sector público
Comparación de enfoques de autoclasificación sobre un corpus de registros de transporte de 272,000 archivos y 727 gigabytes

Resumen ejecutivo
El Departamento de Transporte de Utah (UDOT) estaba implementando Knowvation, una nueva herramienta de indexación y descubrimiento de información de PTFS que ofrece búsqueda de texto completo, facetada y espacial junto con rastreo automatizado de discos y extracción de metadatos, y quería una orientación rigurosa y empírica sobre la mejor manera de clasificar sus documentos dentro de ella. El desafío central de UDOT era buscar y encontrar planos antiguos, acuerdos y datos de contexto necesarios para informar la planificación de nuevos proyectos de infraestructura de transporte en los mismos sitios o en sitios colindantes. Esa información estaba repartida en un corpus de 272.000 archivos con un total de 727 gigabytes, en el que los tipos de acuerdo específicos que UDOT necesitaba eran solo una pequeña fracción del conjunto.
En el marco del Proyecto cooperativo 20-97 del NCHRP, Iknow realizó una comparación directa entre la clasificación por aprendizaje automático y la basada en reglas para cinco tipos de acuerdo — de Servicios Públicos, de Mantenimiento, Cooperativos, de Mejoras y de Drenaje — y construyó scripts de extracción de entidades para obtener datos estructurados directamente de los documentos identificados. La comparación, medida mediante precisión y exhaustividad, dio a UDOT una comprensión rigurosa y basada en evidencia de cómo se comportaba realmente cada enfoque de clasificación con sus tipos de documentos reales, junto con una metodología concreta que podía aplicar en adelante y compartir con otros DOT estatales que enfrentan el mismo desafío.
Antecedentes y contexto
Acerca del cliente
El NCHRP fue creado en 1962 por la American Association of State Highway and Transportation Officials como un programa nacional de investigación financiado cooperativamente y administrado por el Transportation Research Board, parte de las National Academies of Sciences, Engineering, and Medicine, en cooperación con la Federal Highway Administration. UDOT, la agencia estatal responsable de planificar, construir y mantener el sistema de carreteras de Utah, se involucró en el Proyecto 20-97 del NCHRP específicamente porque estaba en proceso de implementar Knowvation y quería una base fundamentada en datos para clasificar sus documentos dentro de la nueva plataforma.
Contexto de la industria
Este encargo fue el tercero que Iknow ejecutó dentro del Proyecto 20-97 más amplio del NCHRP, "Improving Findability and Relevance of Transportation Information", tras un piloto anterior y un proyecto de ontología a escala completa para el Departamento de Transporte del Estado de Washington. En conjunto, los tres proyectos demuestran cómo un único programa de investigación cooperativa puede generar una metodología de encontrabilidad reutilizable, probada en múltiples DOT estatales con enfoques técnicos distintos: clasificación ontológica basada en reglas para manuales de ingeniería en Washington, y una comparación empírica directa del aprendizaje automático frente a la clasificación basada en reglas para el archivo de acuerdos de UDOT. La precisión y la exhaustividad son las métricas estándar aceptadas por la industria para evaluar la calidad de la clasificación y la recuperación de información: la precisión mide qué fracción de los resultados recuperados es realmente correcta, la exhaustividad mide qué fracción de todos los documentos verdaderamente relevantes se logró encontrar, y las puntuaciones estándar de la industria suelen comenzar en torno al 60% y mejorarse de forma iterativa, considerándose generalmente un éxito el 80% o más.
Situación actual
El proyecto se centró en buscar y encontrar planos antiguos, acuerdos y datos de contexto necesarios para informar la planificación de la construcción de nuevos proyectos de infraestructura de transporte en los mismos sitios o en sitios colindantes, abarcando cinco casos de uso reales: la definición del alcance de proyectos de pavimentación, los estudios de corredores, el análisis ambiental, las solicitudes de registros públicos y los acuerdos de investigación. El material de origen documentaba un ejemplo concreto de lo que estaba en juego: el personal de UDOT recordaba un acuerdo previo con un ferrocarril que podía afectar la retirada planificada de un puente, pero el propio ferrocarril no podía localizar el acuerdo, y el proyecto no podía avanzar sin él.
Problema / desafío
- Un corpus documental masivo y en gran parte sin clasificar, con un problema de aguja en un pajar. El corpus sumaba 272.000 archivos y 727 gigabytes, y los tipos de acuerdo objetivo — de Servicios Públicos, de Mantenimiento, Cooperativos, de Mejoras y de Drenaje — representaban solo un pequeño porcentaje del total, lo que los hacía genuinamente difíciles de encontrar incluso cuando eran críticos para un proyecto.
- Cinco casos de uso distintos y de alto riesgo, con consecuencias reales si faltaban documentos. La definición del alcance de proyectos de pavimentación, los estudios de corredores, el análisis ambiental, las solicitudes de registros públicos y los acuerdos de investigación dependían todos de encontrar el acuerdo o informe previo correcto, como demostró el propio ejemplo de UDOT del puente cuya retirada quedó estancada.
- Ninguna base empírica para elegir entre dos enfoques de clasificación viables. Tanto el aprendizaje automático como la clasificación basada en reglas ofrecían caminos plausibles para autoclasificar el corpus, pero UDOT no contaba con una comparación rigurosa y fundamentada en datos de cómo se comportaría cada uno con sus tipos de documentos específicos antes de comprometerse con uno.
- La clasificación por sí sola no bastaba; había que extraer datos específicos del interior de los documentos. Saber que un archivo era un acuerdo no respondía la pregunta planteada; UDOT necesitaba que se extrajeran el número de proyecto, las partes del acuerdo, el identificador fiscal y la fecha del acuerdo para que los resultados etiquetados fueran genuinamente útiles.
Objetivos del proyecto
- Desarrollar y aplicar métodos basados en reglas y de aprendizaje automático para asignar tipos de acuerdo a los archivos, y comparar los resultados.
- Desarrollar scripts de extracción de entidades para obtener campos de datos estructurados específicos de los documentos de acuerdos, incluidos el número de proyecto, la parte del acuerdo, el identificador fiscal y la fecha del acuerdo.
- Crear un archivo de salida con las etiquetas asignadas y las referencias a los archivos para complementar los metadatos existentes de Knowvation.
- Producir una comparación rigurosa, basada en precisión y exhaustividad, de los dos enfoques de clasificación para guiar los futuros esfuerzos de autoclasificación de los DOT.
El enfoque de Iknow
Cómo estructuró Iknow el trabajo
Iknow desarrolló y probó en paralelo los enfoques de clasificación por aprendizaje automático y basada en reglas contra el mismo corpus y los mismos cinco tipos de acuerdo objetivo, evaluando ambos mediante precisión y exhaustividad para que UDOT pudiera ver exactamente cómo se comportaba cada método en lugar de depender de impresiones subjetivas.
Actividades y decisiones clave
- Enfoque de aprendizaje automático. Iknow utilizó el lenguaje de programación de código abierto Python 3.6, instalado mediante la distribución Anaconda 3, junto con NLTK para el procesamiento de texto — tokenización, stemming, etiquetado, análisis sintáctico y razonamiento semántico — y Scikit-learn, una biblioteca de aprendizaje automático con algoritmos de clasificación, regresión y agrupamiento que interoperan con NumPy y SciPy. Iknow entrenó clasificadores de aprendizaje automático para identificar cada tipo de acuerdo a partir de ejemplos de entrenamiento etiquetados.
- Clasificación basada en reglas. Iknow escribió reglas lógicas personalizadas para cada uno de los cinco tipos de acuerdo, utilizando tanto la asignación directa de categorías mediante IF-THEN como reglas ponderadas y puntuadas que sumaban la evidencia de presencia de términos en secciones definidas del documento para determinar su categoría.
- Extracción de entidades. Utilizando los módulos de coincidencia de expresiones de NLTK en Python, Iknow construyó scripts de extracción que obtenían el número de proyecto, la parte del acuerdo, el identificador fiscal (para los acuerdos de drenaje) y la fecha del acuerdo directamente de los documentos identificados como acuerdos.
- Evaluación y ajuste. Iknow midió ambos enfoques mediante precisión y exhaustividad, ajustando iterativamente los conjuntos de entrenamiento del aprendizaje automático y los conjuntos de reglas a los datos. Añadir "evidencia negativa" — ejemplos de no-acuerdos — mejoró tanto la precisión como la exhaustividad de ambos métodos.
- Integración de la salida. Iknow creó un archivo de salida con las etiquetas asignadas y las referencias a los archivos correspondientes, diseñado para complementar los metadatos ya presentes en Knowvation.
Partes interesadas y colaboración
Iknow trabajó como subcontratista del contratista principal Spy Pond Partners bajo la supervisión del NCHRP, entregando resultados destinados al uso directo de UDOT y a una aplicación más amplia en otros DOT estatales que enfrentan desafíos similares de clasificación de grandes corpus.
Desafíos y cómo Iknow los superó
Encontrar de forma confiable tipos de contenido escasos dentro de un corpus masivo
Los tipos de acuerdo objetivo representaban una pequeña fracción de un corpus de 272.000 archivos y 727 gigabytes, lo que creaba un riesgo real de que cualquiera de los métodos de clasificación por sí solo pudiera pasar por alto documentos críticos o enterrarlos entre falsos positivos. Iknow lo abordó ejecutando en paralelo dos metodologías de clasificación independientes y construidas a medida contra el mismo corpus y los mismos tipos objetivo, en lugar de apostar por un único enfoque no probado, y midiendo ambas rigurosamente con precisión y exhaustividad para que UDOT pudiera ver exactamente cómo se comportaba cada una.
Interpretar resultados mixtos de forma útil y accionable
Algunos resultados, como una puntuación de exhaustividad notablemente baja para los acuerdos de servicios públicos, corrían el riesgo de leerse como un fracaso del método en lugar de entenderse correctamente. Iknow lo abordó diagnosticando explícitamente la causa de los resultados anómalos — en ese caso, un tamaño de muestra pequeño y no un defecto del método. Iknow proporcionó luego vías de mejora concretas y específicas para cada método: más ejemplos de entrenamiento positivos y negativos para el aprendizaje automático, y un refinamiento de reglas guiado por los falsos positivos para la clasificación basada en reglas, convirtiendo un ejercicio de evaluación comparativa en una hoja de ruta de mejora accionable.
Resultados e impacto
Resultados operativos
- Análisis de un corpus de 272.000 archivos con un total de 727 gigabytes para localizar cinco tipos de acuerdo objetivo que constituían una pequeña fracción del contenido total.
- Comparación directa de ambos enfoques en los Acuerdos de Mantenimiento: el aprendizaje automático alcanzó un 93% de precisión y un 86% de exhaustividad, mientras que la clasificación basada en reglas alcanzó un 78% de precisión y un 95% de exhaustividad — mostrando un claro equilibrio entre precisión y exhaustividad entre los dos métodos.
- Aplicación de la clasificación basada en reglas a cuatro tipos de acuerdo adicionales, logrando un 95% de precisión en los Acuerdos de Servicios Públicos, un 82% de precisión y un 79% de exhaustividad en los Acuerdos de Mejoras, un 100% de precisión y un 75% de exhaustividad en los Acuerdos de Drenaje, y un 93% de precisión y un 71% de exhaustividad en los Acuerdos Cooperativos.
Resultados estratégicos y organizacionales
La mayoría de los resultados alcanzó o se acercó al umbral de éxito estándar de la industria del 80% en precisión y exhaustividad, y los scripts de extracción de entidades de Iknow obtuvieron con éxito datos estructurados — números de proyecto, partes de los acuerdos, identificadores fiscales y fechas de los acuerdos — directamente de los acuerdos identificados, produciendo un archivo de salida que complementó los metadatos existentes de Knowvation. Dado que la metodología y los hallazgos se desarrollaron dentro del programa de investigación cooperativa del NCHRP, fueron diseñados explícitamente para ser aplicables y replicables en otros DOT estatales que enfrentan desafíos similares de clasificación de grandes corpus, y no solo utilizables por UDOT.
Tiempo hasta el impacto
El encargo de Iknow duró 18 meses.
Capacidades de Iknow demostradas
Competencias principales
- Autoclasificación basada en aprendizaje automático
- Ingeniería de clasificación basada en reglas
- Extracción de entidades y captura de datos estructurados
- Evaluación comparativa de la exactitud de la clasificación
Métodos y marcos
- Evaluación de la clasificación basada en precisión y exhaustividad
- Comparación paralela de metodologías de aprendizaje automático frente a reglas
- Ajuste iterativo de conjuntos de entrenamiento y conjuntos de reglas
- Refinamiento de la clasificación informado por evidencia negativa
Tecnologías y herramientas
- Python 3.6 (vía Anaconda 3), NLTK y Scikit-learn
- Knowvation (plataforma de indexación y descubrimiento de información de PTFS)
Casos de estudio relacionados
Ponga esta experiencia a trabajar en su problema.
Gran parte de nuestro trabajo nunca llega a la web. Reserve una llamada, cuéntenos su sector y le mostraremos los proyectos que corresponden al suyo.
