الثورة / هاشم السريحي
في ظل تصاعد الهجمات السيبرانية وتعقّد أساليب استهداف الشبكات، طوّر باحثون من جامعة صنعاء نموذجًا قائمًا على التعلم الآلي للكشف عن الهجمات والتسللات الشبكية، محققًا دقة بلغت 99.27 %، إلى جانب 94.31 % في الدقة الإيجابية، و94.4 % في الاستدعاء، و94.10 % في مقياس F1 .
الدراسة، التي حملت عنوان «Attacks Detection Model Based on a Machine Learning Algorithm»، أعدّها إسراء عبد الوازكول، وعبدالرحمن الصبري، وسعاد محمد عثمان من كلية الحاسوب وتكنولوجيا المعلومات بجامعة صنعاء، ونُشرت في مجلة جامعة صنعاء للعلوم التطبيقية والتكنولوجيا في فبراير 2026م.
نموذج من مرحلتين
يعتمد النموذج على دمج خوارزميتين؛ الأولى تحليل المكونات الرئيسية ((PCA لتقليل أبعاد البيانات واختيار الخصائص الأكثر أهمية، والثانية آلة المتجهات الداعمة ( (SVM لتصنيف الاتصالات والكشف عن الهجمات.
واستخدم الباحثون مجموعة بيانات NSL-KDD، التي تضم 41 سمة تصف كل اتصال شبكي، مع تحديد ما إذا كان الاتصال طبيعيًا أو يمثل هجومًا.
وبعد معالجة البيانات وتطبيعها وترميز المتغيرات، نجحت خوارزمية PCA في اختزال السمات إلى 26 مكوّنًا رئيسيًا مع الاحتفاظ بأكثر من 95 % من التباين الكلي للبيانات. ويرى الباحثون أن هذا الاختزال يساعد على خفض التعقيد الحسابي وتسريع عملية التدريب والتنفيذ.
وقُسمت البيانات إلى 70 % للتدريب و30 % للاختبار، ثم استخدمت SVM في مرحلة التصنيف. واعتمد النموذج نواة خطية وقيمة C تبلغ 1.0.
وتشير الدراسة إلى أن الدقة المرتفعة تعكس قدرة النموذج على التمييز بين الاتصالات الطبيعية والهجمات، بينما تعكس نتيجة Recall البالغة 94.4 % قدرته على اكتشاف معظم الحالات الإيجابية الفعلية. كما أظهر F1-Score البالغ 94.10 % توازنًا جيدًا بين تقليل الإنذارات الخاطئة وزيادة الحالات المكتشفة.
وتكشف الدراسة أن الأداء لم يكن متساويًا بين جميع أنواع الهجمات؛ إذ تركزت بعض حالات False Negatives في فئتي U2R وR2L، وهما من الفئات ذات التمثيل المحدود في مجموعة NSL-KDD.
في المقابل، حققت فئات مثل DoS وProbe معدلات كشف أفضل، بسبب توفر عدد أكبر من العينات ووجود أنماط أكثر وضوحًا في البيانات.
كما واجه النموذج صعوبة في بعض الحالات التي تتشابه فيها حركة الشبكات الطبيعية مع أنماط الاستطلاع الشبكي، ما يجعل الفصل بينها أكثر تعقيدًا حتى بعد استخدام PCA.
مقارنة بالدراسات السابقة
قارنت الدراسة النموذج المقترح بعدد من النماذج السابقة، وأظهرت النتائج أن النموذج حقق 99.27 % في الدقة الكلية، متفوقًا في هذا المؤشر على عدد من الدراسات التي سجلت 97.8 % و98 % و98.3 % و98.72 %، فيما سجلت إحدى الدراسات 99.8 %.
لكن المقارنة لا تعني التفوق في جميع المؤشرات؛ إذ حققت بعض النماذج السابقة نتائج أعلى في Precision أو Recall أو F1. وتبرز الدراسة أن ميزة النموذج المقترح تتمثل في الجمع بين تقليص الأبعاد وتحقيق أداء مرتفع مع خفض التعقيد الحسابي.
نحو كشف أسرع للهجمات
لم تركز الدراسة على الدقة فقط، بل استهدفت أيضًا تقليل الوقت اللازم للتدريب والاختبار، بما يجعل النموذج مناسبًا للبيئات التي تحتاج إلى استجابة سريعة.
وأجريت التجارب باستخدام Python وAnaconda على حاسوب مزود بمعالج Core i7 وذاكرة 16 غيغابايت. وأظهرت النتائج أن تقليص البيانات من 41 سمة إلى 26 مكوّنًا ساعد في خفض التعقيد الحسابي وتحسين كفاءة النموذج.
تحديات التطبيق الواقعي
ورغم النتائج المرتفعة، تؤكد الدراسة أن النموذج لا يزال بحاجة إلى اختبارات في بيئات حقيقية قبل اعتماده على نطاق واسع.
وتشير إلى ثلاثة تحديات رئيسية: تغير طبيعة حركة البيانات في الشبكات الحقيقية مقارنة بمجموعات البيانات المعيارية، وقيود قابلية التوسع عند التعامل مع تدفقات ضخمة من البيانات، إضافة إلى محدودية قدرة SVM على التكيف تلقائيًا مع الهجمات الجديدة، ما يستدعي إعادة تدريب النموذج عند ظهور أنماط جديدة.
ولهذا تقترح الدراسة في أعمالها المستقبلية تطبيق النموذج على بيانات حقيقية من بيئات الحوسبة السحابية، إلى جانب اختبار نماذج تعتمد على التعلم العميق ومجموعات بيانات مختلفة.
من 41 سمة إلى 26.. ودقة تتجاوز 99 %
وتخلص الدراسة إلى أن دمج PCA وSVM وفر نموذجًا قادرًا على تقليل أبعاد بيانات الشبكات مع الحفاظ على أكثر من 95 % من معلوماتها المهمة، وتحقيق 99.27 % دقة كلية و94.10 % في F1-Score.
وبحسب نتائج الدراسة، فإن الجمع بين تقليل حجم البيانات، وخفض التعقيد الحسابي، وسرعة المعالجة، والدقة المرتفعة يجعل النموذج واعدًا في مجال كشف التسللات، مع بقاء اختباره على بيانات الشبكات الحقيقية والمتغيرة الخطوة الضرورية التالية للتحقق من فعاليته خارج بيئة الاختبار.
