التعلم الآلي في مواجهة القواعد: اختبار تصنيف مباشر لأرشيف وثائق DOT في ولاية يوتا.
البرنامج الوطني التعاوني لأبحاث الطرق السريعة، مجلس أبحاث النقل، الأكاديميات الوطنية للعلوم والهندسة والطب (National Cooperative Highway Research Program, Transportation Research Board, National Academies of Sciences Engineering and Medicine) · القطاع الحكومي
مقارنة نهجي التصنيف الآلي عبر مجموعة سجلات نقل تضم 272,000 ملف بحجم 727 غيغابايت

الملخص التنفيذي
كانت وزارة النقل في ولاية يوتا (UDOT) بصدد تنفيذ Knowvation، وهي أداة جديدة لفهرسة المعلومات واكتشافها من PTFS توفر البحث في النص الكامل والبحث الموجّه بالأوجه والبحث المكاني إلى جانب الزحف الآلي على الأقراص واستخراج البيانات الوصفية، وأرادت توجيهاً صارماً وتجريبياً حول أفضل طريقة لتصنيف مستنداتها داخلها. كان التحدي الجوهري لدى UDOT هو البحث عن المخططات القديمة والاتفاقيات والبيانات الأساسية اللازمة لتوجيه التخطيط لمشاريع بنية تحتية جديدة للنقل في المواقع نفسها أو المواقع المتاخمة، والعثور عليها. وكانت تلك المعلومات موزعة عبر مجموعة تضم 272,000 ملف بإجمالي 727 جيجابايت، لم تكن فيها أنواع الاتفاقيات المحددة التي تحتاجها UDOT سوى جزء صغير من الكل.
في إطار المشروع التعاوني 20-97 التابع لبرنامج NCHRP، أجرت Iknow مقارنة مباشرة بين التصنيف بالتعلم الآلي والتصنيف القائم على القواعد عبر خمسة أنواع من الاتفاقيات — المرافق، والصيانة، والتعاون، والتحسين، والصرف — وبنت نصوصاً برمجية لاستخراج الكيانات لسحب بيانات منظمة مباشرة من المستندات المحددة. وقد منحت المقارنة، المقيسة باستخدام الدقة والاستدعاء، وزارة UDOT فهماً صارماً قائماً على الأدلة لكيفية أداء كل نهج تصنيف فعلياً على أنواع مستنداتها الحقيقية، إلى جانب منهجية ملموسة يمكنها تطبيقها مستقبلاً ومشاركتها مع وزارات نقل الولايات الأخرى التي تواجه التحدي نفسه.
الخلفية والسياق
نبذة عن العميل
أُنشئ برنامج NCHRP عام 1962 على يد American Association of State Highway and Transportation Officials كبرنامج بحثي وطني ممول تعاونياً تديره Transportation Research Board، وهي جزء من National Academies of Sciences, Engineering, and Medicine، بالتعاون مع Federal Highway Administration. أما UDOT، وهي جهة الولاية المسؤولة عن تخطيط شبكة الطرق السريعة في يوتا وبنائها وصيانتها، فقد انخرطت في المشروع 20-97 التابع لـNCHRP تحديداً لأنها كانت في طور تنفيذ Knowvation وأرادت أساساً قائماً على البيانات لتصنيف مستنداتها داخل المنصة الجديدة.
سياق القطاع
كانت هذه المهمة هي الثالثة التي تنفذها Iknow في إطار مشروع NCHRP الأوسع 20-97، "Improving Findability and Relevance of Transportation Information"، بعد تجربة أولية سابقة ومشروع أنطولوجيا واسع النطاق لوزارة النقل في ولاية واشنطن. وتُظهر المشاريع الثلاثة معاً كيف يمكن لبرنامج بحثي تعاوني واحد أن يولّد منهجية قابلة لإعادة الاستخدام لسهولة العثور على المعلومات، مختبرة عبر عدة وزارات نقل ولايات بمقاربات تقنية مختلفة — تصنيف أنطولوجي قائم على القواعد لأدلة الهندسة في واشنطن، ومقارنة تجريبية مباشرة بين التعلم الآلي والتصنيف القائم على القواعد لأرشيف اتفاقيات UDOT. والدقة والاستدعاء هما المقياسان المعياريان المقبولان في القطاع لتقييم جودة التصنيف واسترجاع المعلومات: تقيس الدقة نسبة النتائج المسترجعة الصحيحة فعلاً، ويقيس الاستدعاء نسبة ما عُثر عليه بنجاح من مجموع المستندات ذات الصلة حقاً، وعادةً ما تبدأ الدرجات المعيارية في القطاع حول 60% وتُحسَّن تكرارياً، مع اعتبار 80% أو أكثر نجاحاً بوجه عام.
الوضع الراهن
ركّز المشروع على البحث عن المخططات القديمة والاتفاقيات والبيانات الأساسية اللازمة لتوجيه تخطيط البناء لمشاريع بنية تحتية جديدة للنقل في المواقع نفسها أو المواقع المتاخمة والعثور عليها، شاملاً خمس حالات استخدام واقعية: تحديد نطاق مشاريع الرصف، ودراسات الممرات، والتحليل البيئي، وطلبات السجلات العامة، واتفاقيات البحث. ووثّقت المواد المصدرية مثالاً ملموساً على حجم المخاطر — إذ تذكّر موظفو UDOT اتفاقية سابقة مع شركة سكك حديدية قد تؤثر على إزالة جسر مخطط لها، لكن شركة السكك الحديدية نفسها لم تتمكن من العثور على الاتفاقية، ولم يكن بالإمكان المضي في المشروع من دونها.
المشكلة / التحدي
- مجموعة مستندات ضخمة وغير مصنفة إلى حد كبير مع مشكلة إبرة في كومة قش. بلغ إجمالي المجموعة 272,000 ملف و727 جيجابايت، ولم تمثل أنواع الاتفاقيات المستهدفة — المرافق، والصيانة، والتعاون، والتحسين، والصرف — سوى نسبة صغيرة من الإجمالي، مما جعل العثور عليها صعباً حقاً حتى عندما تكون حاسمة لمشروع ما.
- خمس حالات استخدام متمايزة وعالية المخاطر بعواقب حقيقية لفقدان المستندات. اعتمد تحديد نطاق مشاريع الرصف ودراسات الممرات والتحليل البيئي وطلبات السجلات العامة واتفاقيات البحث جميعها على العثور على الاتفاقية أو التقرير السابق الصحيح، كما أثبت مثال UDOT نفسه عن مشروع إزالة الجسر المتعثر.
- غياب أساس تجريبي للاختيار بين نهجي تصنيف قابلين للتطبيق. قدّم كل من التعلم الآلي والتصنيف القائم على القواعد مسارين معقولين للتصنيف الآلي للمجموعة، لكن UDOT لم تكن تملك مقارنة صارمة قائمة على البيانات لكيفية أداء كل منهما على أنواع مستنداتها المحددة قبل الالتزام بأحدهما.
- لم يكن التصنيف وحده كافياً؛ إذ كان يلزم استخراج بيانات محددة من داخل المستندات. معرفة أن ملفاً ما اتفاقية لم تكن تجيب عن السؤال المطروح؛ فقد احتاجت UDOT إلى استخراج رقم المشروع وأطراف الاتفاقية والمعرّف الضريبي وتاريخ الاتفاقية لجعل النتائج الموسومة مفيدة حقاً.
أهداف المشروع
- تطوير وتطبيق أساليب قائمة على القواعد وأساليب تعلم آلي لإسناد أنواع الاتفاقيات إلى الملفات، ومقارنة النتائج.
- تطوير نصوص برمجية لاستخراج الكيانات لسحب حقول بيانات منظمة محددة من مستندات الاتفاقيات، بما في ذلك رقم المشروع وطرف الاتفاقية والمعرّف الضريبي وتاريخ الاتفاقية.
- إنشاء ملف مخرجات يتضمن الوسوم المسندة ومراجع الملفات لإثراء البيانات الوصفية القائمة في Knowvation.
- إنتاج مقارنة صارمة قائمة على الدقة والاستدعاء بين نهجي التصنيف لتوجيه جهود التصنيف الآلي المستقبلية لدى وزارات النقل.
نهج Iknow
كيف هيكلت Iknow العمل
طوّرت Iknow واختبرت نهجي التصنيف بالتعلم الآلي والقائم على القواعد بالتوازي على المجموعة نفسها وأنواع الاتفاقيات الخمسة المستهدفة نفسها، مقيّمة كليهما باستخدام الدقة والاستدعاء حتى تتمكن UDOT من رؤية أداء كل أسلوب بدقة بدلاً من الاعتماد على انطباعات ذاتية.
الأنشطة والقرارات الرئيسية
- نهج التعلم الآلي. استخدمت Iknow لغة البرمجة مفتوحة المصدر Python 3.6، المثبتة عبر توزيعة Anaconda 3، إلى جانب NLTK لمعالجة النصوص — التقطيع والتجذيع والوسم والتحليل النحوي والاستدلال الدلالي — وScikit-learn، وهي مكتبة تعلم آلي تضم خوارزميات التصنيف والانحدار والتجميع وتتكامل مع NumPy وSciPy. ودرّبت Iknow مصنِّفات تعلم آلي على تحديد كل نوع اتفاقية من أمثلة تدريب موسومة.
- التصنيف القائم على القواعد. كتبت Iknow قواعد منطقية مخصصة لكل نوع من أنواع الاتفاقيات الخمسة، مستخدمة الإسناد المباشر للفئات بصيغة IF-THEN وقواعد مرجحة ومقيّمة بالدرجات تجمع أدلة وجود المصطلحات عبر أقسام محددة من المستند لتحديد فئته.
- استخراج الكيانات. باستخدام وحدات مطابقة التعابير في NLTK بلغة Python، بنت Iknow نصوصاً برمجية للاستخراج تسحب رقم المشروع وطرف الاتفاقية والمعرّف الضريبي (لاتفاقيات الصرف) وتاريخ الاتفاقية مباشرة من المستندات المحددة كاتفاقيات.
- التقييم والضبط. قاست Iknow النهجين باستخدام الدقة والاستدعاء، مع ضبط تكراري لمجموعات تدريب التعلم الآلي ومجموعات القواعد وفق البيانات. وقد أدّت إضافة "الأدلة السلبية" — أمثلة على غير الاتفاقيات — إلى تحسين الدقة والاستدعاء معاً في كلا الأسلوبين.
- تكامل المخرجات. أنشأت Iknow ملف مخرجات يتضمن الوسوم المسندة ومراجع الملفات المقابلة، مصمماً لإثراء البيانات الوصفية الموجودة أصلاً في Knowvation.
أصحاب المصلحة والتعاون
عملت Iknow متعاقداً من الباطن لدى المتعاقد الرئيسي Spy Pond Partners تحت إشراف NCHRP، مسلّمة نتائج مخصصة للاستخدام المباشر من قبل UDOT وللتطبيق الأوسع لدى وزارات نقل ولايات أخرى تواجه تحديات مماثلة في تصنيف المجموعات الضخمة.
التحديات وكيف تغلبت عليها Iknow
العثور الموثوق على أنواع محتوى نادرة داخل مجموعة ضخمة
مثّلت أنواع الاتفاقيات المستهدفة جزءاً صغيراً من مجموعة تضم 272,000 ملف و727 جيجابايت، مما خلق خطراً حقيقياً بأن يُغفل أي من أسلوبي التصنيف بمفرده مستندات حاسمة أو يدفنها وسط نتائج إيجابية زائفة. عالجت Iknow ذلك بتشغيل منهجيتي تصنيف مستقلتين مبنيتين لهذا الغرض بالتوازي على المجموعة نفسها والأنواع المستهدفة نفسها، بدلاً من المراهنة على نهج واحد غير مختبر، وبقياس كلتيهما بصرامة بالدقة والاستدعاء حتى ترى UDOT بدقة كيفية أداء كل منهما.
تفسير النتائج المتباينة بطريقة مفيدة وقابلة للتنفيذ
كانت بعض النتائج، مثل درجة استدعاء منخفضة بشكل ملحوظ لاتفاقيات المرافق، معرضة لأن تُقرأ كفشل للأسلوب بدلاً من فهمها فهماً صحيحاً. عالجت Iknow ذلك بتشخيص صريح للسبب وراء النتائج الشاذة — وهو في تلك الحالة صغر حجم العينة لا عيب في الأسلوب. ثم قدّمت Iknow مسارات تحسين ملموسة خاصة بكل أسلوب: مزيد من أمثلة التدريب الإيجابية والسلبية للتعلم الآلي، وتنقيح للقواعد موجّه بالنتائج الإيجابية الزائفة للتصنيف القائم على القواعد، محوّلة تمرين معايرة إلى خارطة طريق تحسين قابلة للتنفيذ.
النتائج والأثر
النتائج التشغيلية
- تحليل مجموعة من 272,000 ملف بإجمالي 727 جيجابايت لتحديد خمسة أنواع اتفاقيات مستهدفة تشكل جزءاً صغيراً من إجمالي المحتوى.
- مقارنة مباشرة بين النهجين على اتفاقيات الصيانة: حقق التعلم الآلي دقة 93% واستدعاء 86%، بينما حقق التصنيف القائم على القواعد دقة 78% واستدعاء 95% — بما يُظهر مقايضة واضحة بين الدقة والاستدعاء بين الأسلوبين.
- تطبيق التصنيف القائم على القواعد على أربعة أنواع اتفاقيات إضافية، محققاً دقة 95% في اتفاقيات المرافق، ودقة 82% واستدعاء 79% في اتفاقيات التحسين، ودقة 100% واستدعاء 75% في اتفاقيات الصرف، ودقة 93% واستدعاء 71% في اتفاقيات التعاون.
النتائج الاستراتيجية والتنظيمية
بلغت معظم النتائج عتبة النجاح المعيارية في القطاع البالغة 80% للدقة والاستدعاء أو اقتربت منها، ونجحت نصوص Iknow البرمجية لاستخراج الكيانات في سحب بيانات منظمة — أرقام المشاريع وأطراف الاتفاقيات والمعرّفات الضريبية وتواريخ الاتفاقيات — مباشرة من الاتفاقيات المحددة، منتجة ملف مخرجات أثرى البيانات الوصفية القائمة في Knowvation. ولأن المنهجية والنتائج طُوّرتا في إطار برنامج البحث التعاوني لـNCHRP، فقد صُمّمتا صراحةً لتكونا قابلتين للتطبيق والتكرار لدى وزارات نقل ولايات أخرى تواجه تحديات مماثلة في تصنيف المجموعات الضخمة، لا لتقتصر فائدتهما على UDOT وحدها.
المدة حتى تحقق الأثر
استغرقت مهمة Iknow 18 شهراً.
قدرات Iknow التي أثبتها المشروع
المهارات الأساسية
- التصنيف الآلي القائم على التعلم الآلي
- هندسة التصنيف القائم على القواعد
- استخراج الكيانات والتقاط البيانات المنظمة
- معايرة دقة التصنيف
الأساليب والأطر
- تقييم التصنيف القائم على الدقة والاستدعاء
- مقارنة متوازية بين منهجيتي التعلم الآلي والقواعد
- ضبط تكراري لمجموعات التدريب ومجموعات القواعد
- تنقيح التصنيف المستنير بالأدلة السلبية
التقنيات والأدوات
- Python 3.6 (عبر Anaconda 3) وNLTK وScikit-learn
- Knowvation (منصة PTFS لفهرسة المعلومات واكتشافها)
ضع هذه الخبرة في خدمة مشكلتك.
كثير من أعمالنا لا يظهر على الموقع. احجز مكالمة وأخبرنا عن قطاعك وسنعرض عليك المشاريع التي تقابل مجالك.
