Aplicación de procesamiento de lenguaje natural y reglas personalizadas para convertir datos laborales no estructurados en informes de tendencias.
Firma independiente de investigación y asesoramiento tecnológico · Software y servicios
Análisis de 8,000 ofertas de empleo para revelar hacia dónde se dirigía el mercado de talento en BI

Resumen ejecutivo
La Empresa M quería analizar las ofertas de empleo del campo de la inteligencia de negocio (BI) a lo largo de dos años para informar sobre las tendencias relevantes, pero la información que necesitaba estaba enterrada en el texto no estructurado de las ofertas, lo que exigía herramientas sofisticadas de procesamiento de lenguaje natural para extraerla. La Empresa M contrató a Iknow para minar, depurar y analizar los datos. Indeed aportó más de 8,000 ofertas de empleo para el proyecto, cada una con al menos una de ocho frases relacionadas con BI en el título del puesto, recopiladas aproximadamente la mitad en junio de 2007 y la otra mitad en junio de 2008. El alcance de Iknow consistía en extraer del texto no estructurado ubicaciones geográficas, sectores industriales, nombres de proveedores de BI, rangos salariales, niveles de competencias y tendencias temporales, depurar y estandarizar los resultados y presentar la información en un conjunto de gráficos.
A lo largo de unos tres meses, Iknow ejecutó una cadena de trabajo de cuatro pasos: preprocesamiento para limpiar y estructurar los datos brutos de las ofertas, extracción de entidades con el software SAP BusinessObjects Text Analysis mediante catálogos de nombres y conjuntos de reglas personalizados, postprocesamiento en una base de datos Microsoft SQL Server para estandarizar y segmentar los datos, y creación de gráficos en Xcelsius para presentar los resultados en ocho dimensiones, incluidas geografía, industria, principales empresas contratantes, ingresos, salario, proveedores de BI, categorías de puestos y competencias. Iknow entregó dos hojas de cálculo completas con los datos de origen, 29 hojas de cálculo de resumen y nueve archivos de PowerPoint de resumen con gráficos, el conjunto completo de productos que la Empresa M necesitaba para preparar su informe de tendencias.
Antecedentes y contexto
Acerca del Cliente
La Empresa M es una de las firmas independientes de investigación y asesoría en tecnología y negocios más destacadas del mundo, conocida por su análisis neutral respecto a los proveedores.
Contexto del Sector
Hacia 2007 y 2008, la inteligencia de negocio se había convertido en una de las categorías de mayor crecimiento dentro de las TI empresariales, impulsando una demanda creciente de puestos especializados en BI que las fuentes tradicionales de datos del mercado laboral solían tardar en captar. Los portales de empleo en línea habían empezado a acumular grandes volúmenes de datos de contratación en tiempo real, ofreciendo una ventana mucho más actual a un mercado laboral emergente que la investigación basada en encuestas, pero esos datos residían por completo en texto libre no estructurado, invisibles para el análisis cuantitativo convencional sin procesamiento de lenguaje natural. Para una firma de investigación como la Empresa M, conocida por seguir de cerca la adopción de tecnología empresarial, la minería de texto sobre ofertas de empleo reales ofrecía una forma más fundamentada en evidencia de informar sobre hacia dónde se dirigía el mercado de talento de BI, en lugar de depender únicamente de encuestas o del juicio de los analistas.
Situación Actual
La Empresa M quería analizar las ofertas de empleo del campo de BI a lo largo de dos años para poder informar sobre las tendencias relevantes, pero como la información deseada estaba enterrada dentro del texto de las ofertas, eran necesarias herramientas sofisticadas de procesamiento de lenguaje natural para extraer los datos. Indeed aportó más de 8,000 ofertas de empleo que contenían alguna de ocho frases relacionadas con BI en el título del puesto, repartidas aproximadamente a partes iguales entre junio de 2007 y junio de 2008, y la Empresa M contrató a Iknow para minar, depurar y analizar los datos.
Problema / desafío
- Datos deseados encerrados en texto no estructurado. Los datos del mercado laboral de BI que necesitaba la Empresa M existían solo como texto libre no estructurado enterrado en más de 8,000 ofertas de empleo, invisibles para el análisis cuantitativo convencional.
- Datos de origen inconsistentes, incompletos e irrelevantes. Las ofertas de empleo variaban enormemente en formato y completitud: nombres de empresas inconsistentes, datos faltantes y ofertas ajenas a BI mezcladas con las genuinamente relevantes.
- Formatos muy variables para los mismos datos subyacentes. Cada tipo de dato deseado aparecía en múltiples formatos y unidades dentro del texto libre, como cifras de ingresos en cinco monedas distintas e información salarial presentada de forma inconsistente.
- Sin un camino de la extracción bruta al análisis publicable. La Empresa M necesitaba que los datos extraídos se depuraran, estandarizaran y tradujeran en gráficos listos para ejecutivos, no una simple extracción en bruto.
Objetivos del proyecto
- Extraer datos geográficos, de industria, de proveedores, salariales, de competencias y de tendencias temporales de más de 8,000 ofertas de empleo de BI no estructuradas.
- Depurar y estandarizar los resultados extraídos en un conjunto de datos consistente y analizable.
- Analizar y presentar la información resultante en un conjunto de gráficos claros que abarcaran múltiples dimensiones del mercado laboral de BI.
- Comparar las tendencias de contratación entre junio de 2007 y junio de 2008 para poner de relieve cambios interanuales significativos.
El enfoque de Iknow
Cómo Estructuró Iknow el Trabajo
Iknow estructuró el proyecto como una cadena de trabajo de cuatro pasos ejecutados en serie (preprocesamiento, extracción de entidades, postprocesamiento y creación de gráficos), reflejando la metodología de clasificación automatizada de contenido de Iknow para convertir un gran volumen de texto no estructurado en un análisis limpio y listo para la toma de decisiones.
Actividades y Decisiones Clave
- Preprocesamiento. Iknow convirtió los archivos de entrada XML en hojas de cálculo de Excel, eliminó descripciones de puestos espurias ajenas a BI, estandarizó nombres de empresas inconsistentes y corrigió manualmente los datos faltantes o erróneos cuando podían determinarse a partir del texto de la oferta, definiendo además nuevos campos de Industria (código NAICS) y Categoría de Puesto en los más de 8,000 registros.
- Extracción de entidades. Con el software SAP BusinessObjects Text Analysis, Iknow ejecutó un proceso de extracción iterativo, construyendo catálogos de nombres personalizados para proveedores de BI, productos y herramientas, y competencias, junto con conjuntos de reglas para extraer los ingresos de las empresas (en cinco monedas y múltiples formatos numéricos) y la información salarial, incluidos rangos y tarifas de contratistas.
- Conjuntos de reglas terminológicas. Iknow también construyó conjuntos de reglas para identificar terminología de datos estructurados, como las variantes de SQL y OLAP, y terminología de datos no estructurados, como minería de texto y extracción de entidades.
- Postprocesamiento y estandarización. Iknow migró los datos depurados a una base de datos Microsoft SQL Server, construyó uniones y vistas para generar distintos cortes de datos, eliminó extracciones duplicadas, convirtió todos los ingresos a dólares estadounidenses y convirtió los rangos salariales en valores medios.
- Creación de cuadros de mando y gráficos. Iknow utilizó las hojas de cálculo resultantes para construir múltiples proyectos de Xcelsius, creando cuadros de mando que mostraban los resultados por geografía, industria, principales empresas contratantes, ingresos, salario, proveedores de BI, categorías de puestos y competencias.
Partes Interesadas y Colaboración
Iknow actuó como contratista principal, trabajando directamente con la Empresa M para entregar el conjunto completo de productos de extracción, depuración y visualización de datos necesarios para respaldar el informe de tendencias que la propia Empresa M publicaría.
Desafíos y cómo Iknow los superó
Normalizar Datos Muy Inconsistentes en un Volumen de Más de 8,000 Registros
Las ofertas de empleo en texto libre variaban enormemente en la denominación de las empresas, la completitud y la relevancia, y hacer esa limpieza manualmente a escala corría el riesgo de ser lento e inconsistente a la vez. Iknow lo abordó construyendo un paso de preprocesamiento disciplinado (eliminando ofertas espurias, estandarizando nombres de empresas y corrigiendo datos faltantes o erróneos) antes de iniciar cualquier extracción automatizada, garantizando que el paso de extracción de entidades operara sobre una base limpia y consistente.
Extraer Entidades Significativas Sin Depender Solo de Software Genérico
El software de análisis de texto estándar no estaba diseñado para reconocer proveedores, productos o competencias específicos de BI, ni los muchos formatos distintos usados para expresar ingresos y salarios en texto libre. Iknow lo abordó construyendo catálogos de nombres y conjuntos de reglas personalizados, adaptados específicamente al vocabulario y los formatos presentes en estas ofertas de empleo, y refinados mediante un proceso de extracción iterativo en lugar de aceptar los resultados por defecto del software.
Resultados e impacto
Resultados Cuantitativos
- Volumen de datos de origen: Más de 8,000 ofertas de empleo analizadas, abarcando junio de 2007 y junio de 2008.
- Alcance de la normalización de datos: Datos estandarizados en cinco monedas y múltiples formatos de ingresos y salarios.
- Categorías de cuadros de mando entregadas: Cuadros de mando de Xcelsius entregados en ocho dimensiones: geografía, industria, empresas, ingresos, salario, proveedores de BI, categorías de puestos y competencias.
- Entregables producidos: Productos finales: 2 hojas de cálculo completas con los datos de origen, 29 hojas de cálculo de resumen y 9 archivos de PowerPoint de resumen con gráficos.
- Duración del proyecto: Encargo de tres meses.
Resultados Cualitativos
Iknow analizó las descripciones de los puestos y creó los productos que la Empresa M necesitaba para preparar su informe, prueba directa de que los resultados del proyecto eran aptos para los propios fines de publicación posteriores de la Empresa M. Al combinar un preprocesamiento riguroso, la extracción de entidades personalizada, el postprocesamiento relacional y cuadros de mando listos para ejecutivos, Iknow convirtió un cuerpo grande y desordenado de texto no estructurado en un conjunto de datos limpio, multidimensional y listo para la toma de decisiones, dando a la Empresa M una base de evidencia para informar sobre las tendencias del mercado laboral de BI fundamentada en datos reales de ofertas de empleo y no únicamente en respuestas de encuestas.
Plazo hasta el Impacto
Durante el proyecto de tres meses, Iknow entregó el conjunto de datos completo, las hojas de cálculo de resumen y los gráficos listos para cuadros de mando, proporcionando a la Empresa M todo lo necesario para empezar a preparar su informe de tendencias.
Capacidades de Iknow demostradas
Competencias Principales
- Minería de texto y procesamiento de lenguaje natural
- Extracción, depuración y estandarización de datos
- Inteligencia de negocio y visualización de datos
- Desarrollo de reglas personalizadas de extracción de entidades
Métodos y Marcos de Trabajo
- Cadena estructurada de minería de texto en cuatro pasos (preprocesamiento, extracción, postprocesamiento, visualización)
- Refinamiento iterativo de reglas
- Segmentación de datos basada en bases de datos relacionales
Tecnologías y Herramientas
- SAP BusinessObjects Text Analysis; Xcelsius (SAP Dashboards)
- Microsoft SQL Server; Microsoft Excel
Casos de estudio relacionados
Ponga esta experiencia a trabajar en su problema.
Gran parte de nuestro trabajo nunca llega a la web. Reserve una llamada, cuéntenos su sector y le mostraremos los proyectos que corresponden al suyo.

