Appliquer le traitement du langage naturel et des règles personnalisées pour transformer des données d'emploi non structurées en rapports de tendances.
Cabinet indépendant de recherche et de conseil en technologie · Logiciels et services
Analyser 8,000 offres d'emploi pour révéler où se dirigeait le marché des talents en BI

Résumé exécutif
La Société M souhaitait analyser les offres d'emploi du domaine de l'informatique décisionnelle (BI) sur deux ans afin de rendre compte des tendances pertinentes, mais l'information dont elle avait besoin était enfouie dans le texte non structuré des offres, exigeant des outils sophistiqués de traitement du langage naturel pour l'extraire. La Société M a engagé Iknow pour explorer, nettoyer et analyser les données. Indeed a fourni plus de 8,000 offres d'emploi pour le projet, chacune contenant au moins l'une de huit expressions liées à la BI dans l'intitulé du poste, environ la moitié collectées en juin 2007 et l'autre moitié en juin 2008. Le périmètre d'Iknow consistait à extraire du texte non structuré les localisations géographiques, les secteurs d'activité, les noms de fournisseurs BI, les fourchettes salariales, les niveaux de compétences et les tendances temporelles, à nettoyer et standardiser les résultats, et à présenter l'information dans un ensemble de graphiques.
Sur environ trois mois, Iknow a exécuté un pipeline en quatre étapes: un prétraitement pour nettoyer et structurer les données brutes des offres, une extraction d'entités à l'aide du logiciel SAP BusinessObjects Text Analysis avec des catalogues de noms et des jeux de règles personnalisés, un post-traitement dans une base de données Microsoft SQL Server pour standardiser et segmenter les données, et la création de graphiques Xcelsius pour présenter les résultats selon huit dimensions, dont la géographie, le secteur, les principales entreprises recruteuses, le chiffre d'affaires, le salaire, les fournisseurs BI, les catégories de postes et les compétences. Iknow a livré deux feuilles de calcul complètes de données sources, 29 feuilles de calcul de synthèse et neuf fichiers PowerPoint de synthèse contenant les graphiques, soit l'ensemble complet des livrables dont la Société M avait besoin pour préparer son rapport de tendances.
Contexte et historique
À propos du Client
La Société M est l'un des cabinets indépendants de recherche et de conseil en technologie et en affaires les plus réputés au monde, connu pour ses analyses neutres vis-à-vis des fournisseurs.
Contexte Sectoriel
En 2007 et 2008, l'informatique décisionnelle était devenue l'une des catégories à la croissance la plus rapide de l'informatique d'entreprise, alimentant une demande croissante de postes BI spécialisés que les sources traditionnelles de données sur le marché du travail tardaient souvent à capter. Les sites d'offres d'emploi en ligne avaient commencé à accumuler d'importants volumes de données de recrutement en temps réel, offrant une fenêtre bien plus actuelle sur un marché du travail émergent que la recherche par sondage, mais ces données résidaient entièrement dans du texte libre non structuré, invisibles pour l'analyse quantitative conventionnelle sans traitement du langage naturel. Pour un cabinet de recherche comme la Société M, connu pour suivre de près l'adoption des technologies d'entreprise, la fouille de texte sur de véritables offres d'emploi offrait un moyen plus fondé sur les faits de rendre compte de la direction que prenait le marché des talents BI, plutôt que de s'appuyer uniquement sur des sondages ou le jugement des analystes.
Situation Actuelle
La Société M souhaitait analyser les offres d'emploi du domaine de la BI sur deux ans afin de pouvoir rendre compte des tendances pertinentes, mais l'information recherchée étant enfouie dans le texte des offres, des outils sophistiqués de traitement du langage naturel étaient nécessaires pour extraire les données. Indeed a fourni plus de 8,000 offres d'emploi contenant l'une de huit expressions liées à la BI dans l'intitulé du poste, réparties à peu près également entre juin 2007 et juin 2008, et la Société M a engagé Iknow pour explorer, nettoyer et analyser les données.
Problème / défi
- Des données recherchées verrouillées dans du texte non structuré. Les données du marché du travail BI dont la Société M avait besoin n'existaient que sous forme de texte libre non structuré enfoui dans plus de 8,000 offres d'emploi, invisibles pour l'analyse quantitative conventionnelle.
- Des données sources incohérentes, incomplètes et non pertinentes. Les offres d'emploi variaient fortement en format et en exhaustivité: noms d'entreprises incohérents, données manquantes et offres hors BI mêlées aux offres réellement pertinentes.
- Des formats très variables pour les mêmes données sous-jacentes. Chaque type de donnée recherché apparaissait dans le texte libre sous de multiples formats et unités, comme des chiffres d'affaires en cinq devises différentes et des informations salariales présentées de façon incohérente.
- Aucun chemin de l'extraction brute à une analyse publiable. La Société M avait besoin que les données extraites soient nettoyées, standardisées et traduites en graphiques prêts pour les dirigeants, et non d'une simple extraction brute.
Objectifs du projet
- Extraire les données géographiques, sectorielles, fournisseurs, salariales, de compétences et de tendances temporelles de plus de 8,000 offres d'emploi BI non structurées.
- Nettoyer et standardiser les résultats extraits en un jeu de données cohérent et analysable.
- Analyser et présenter l'information résultante dans un ensemble de graphiques clairs couvrant plusieurs dimensions du marché de l'emploi BI.
- Comparer les tendances de recrutement entre juin 2007 et juin 2008 pour faire ressortir des évolutions annuelles significatives.
L’approche d’Iknow
Comment Iknow a Structuré le Travail
Iknow a structuré la mission comme un pipeline en quatre étapes exécutées en série (prétraitement, extraction d'entités, post-traitement et création de graphiques), reflétant la méthodologie de classification automatisée de contenu d'Iknow pour transformer un grand volume de texte non structuré en une analyse propre et prête pour la décision.
Activités et Décisions Clés
- Prétraitement. Iknow a converti les fichiers d'entrée XML en feuilles de calcul Excel, supprimé les descriptions de postes parasites hors BI, standardisé les noms d'entreprises incohérents et corrigé manuellement les données manquantes ou erronées lorsqu'elles pouvaient être déterminées à partir du texte de l'offre, en définissant également de nouveaux champs Secteur (code NAICS) et Catégorie de Poste sur l'ensemble des plus de 8,000 enregistrements.
- Extraction d'entités. À l'aide du logiciel SAP BusinessObjects Text Analysis, Iknow a mené un processus d'extraction itératif, en construisant des catalogues de noms personnalisés pour les fournisseurs BI, les produits et outils, et les compétences, ainsi que des jeux de règles pour extraire le chiffre d'affaires des entreprises (en cinq devises et plusieurs formats numériques) et les informations salariales, y compris les fourchettes et les rémunérations des contractuels.
- Jeux de règles terminologiques. Iknow a également construit des jeux de règles pour identifier la terminologie des données structurées, comme les variantes de SQL et d'OLAP, et celle des données non structurées, comme la fouille de texte et l'extraction d'entités.
- Post-traitement et standardisation. Iknow a migré les données nettoyées vers une base de données Microsoft SQL Server, construit des jointures et des vues pour générer différentes segmentations des données, éliminé les extractions en double, converti tous les chiffres d'affaires en dollars américains et converti les fourchettes salariales en valeurs moyennes.
- Création de tableaux de bord et de graphiques. Iknow a utilisé les feuilles de calcul résultantes pour construire plusieurs projets Xcelsius, en créant des tableaux de bord affichant les résultats par géographie, secteur, principales entreprises recruteuses, chiffre d'affaires, salaire, fournisseurs BI, catégories de postes et compétences.
Parties Prenantes et Collaboration
Iknow est intervenu comme contractant principal, en travaillant directement avec la Société M pour livrer l'ensemble complet des livrables d'extraction, de nettoyage et de visualisation des données nécessaires pour appuyer le rapport de tendances publié par la Société M elle-même.
Les défis et comment Iknow les a surmontés
Normaliser des Données Très Incohérentes sur un Volume de Plus de 8,000 Enregistrements
Les offres d'emploi en texte libre variaient énormément dans la dénomination des entreprises, l'exhaustivité et la pertinence, et effectuer ce nettoyage manuellement à cette échelle risquait d'être à la fois lent et incohérent. Iknow y a répondu en construisant une étape de prétraitement disciplinée (suppression des offres parasites, standardisation des noms d'entreprises et correction des données manquantes ou erronées) avant toute extraction automatisée, garantissant que l'étape d'extraction d'entités s'appuie sur une base propre et cohérente.
Extraire des Entités Significatives Sans S'en Remettre au Seul Logiciel Générique
Les logiciels d'analyse de texte prêts à l'emploi n'étaient pas conçus pour reconnaître les fournisseurs, produits ou compétences propres à la BI, ni les nombreux formats différents utilisés pour exprimer le chiffre d'affaires et le salaire en texte libre. Iknow y a répondu en construisant des catalogues de noms et des jeux de règles personnalisés, adaptés spécifiquement au vocabulaire et aux formats présents dans ces offres d'emploi, affinés par un processus d'extraction itératif plutôt qu'en acceptant les résultats par défaut du logiciel.
Résultats et impact
Résultats Quantitatifs
- Volume de données sources: Plus de 8,000 offres d'emploi analysées, couvrant juin 2007 et juin 2008.
- Périmètre de normalisation des données: Données standardisées sur cinq devises et plusieurs formats de chiffre d'affaires et de salaire.
- Catégories de tableaux de bord livrées: Tableaux de bord Xcelsius livrés selon huit dimensions: géographie, secteur, entreprises, chiffre d'affaires, salaire, fournisseurs BI, catégories de postes et compétences.
- Livrables produits: Livrables finaux: 2 feuilles de calcul complètes de données sources, 29 feuilles de calcul de synthèse et 9 fichiers PowerPoint de synthèse contenant les graphiques.
- Durée de la mission: Mission de trois mois.
Résultats Qualitatifs
Iknow a analysé les descriptions de postes et créé les livrables dont la Société M avait besoin pour préparer son rapport, preuve directe que les résultats de la mission étaient adaptés aux propres besoins de publication en aval de la Société M. En combinant un prétraitement rigoureux, une extraction d'entités personnalisée, un post-traitement relationnel et des tableaux de bord prêts pour les dirigeants, Iknow a transformé un vaste corpus désordonné de texte non structuré en un jeu de données propre, multidimensionnel et prêt pour la décision, donnant à la Société M une base factuelle pour rendre compte des tendances du marché du travail BI fondée sur de véritables données d'offres d'emploi plutôt que sur les seules réponses à des sondages.
Délai d'Impact
Au cours de la mission de trois mois, Iknow a livré le jeu de données complet, les feuilles de calcul de synthèse et les graphiques prêts pour les tableaux de bord, fournissant à la Société M tout ce dont elle avait besoin pour commencer à préparer son rapport de tendances.
Les capacités d’Iknow démontrées
Compétences Clés
- Fouille de texte et traitement du langage naturel
- Extraction, nettoyage et standardisation des données
- Informatique décisionnelle et visualisation de données
- Développement de règles personnalisées d'extraction d'entités
Méthodes et Cadres
- Pipeline structuré de fouille de texte en quatre étapes (prétraitement, extraction, post-traitement, visualisation)
- Affinage itératif des règles
- Segmentation des données pilotée par base de données relationnelle
Technologies et Outils
- SAP BusinessObjects Text Analysis; Xcelsius (SAP Dashboards)
- Microsoft SQL Server; Microsoft Excel
Mettez cette expérience au service de votre problème.
Une grande partie de notre travail ne figure jamais sur le site. Réservez un appel, indiquez-nous votre secteur et nous vous présenterons les missions qui correspondent au vôtre.

