Parameters، التقسيم، أخطاء التصنيف، وانتقاء السمات
خلاصة نص السؤال:
- ما الفرق بين parameters وhyperparameters؟ أعط مثالاً في ID3.
- هل تقسيم 50% training / 50% test مكافئ لـ2-fold cross-validation؟
- عرّف FP وFN، ومتى يكون تقليل كل منهما أهم؟
- قارن انتقاء السمات المشرف وغير المشرف: أيهما يعطي سمات أفضل؟
الحل الواضح المختصر
1) وسيط النموذج (Parameter) أم المعامل الفائق (Hyperparameter)؟
وسيط النموذج (Parameter) يتعلمه النموذج من بيانات التدريب؛ في ID3 بنية الشجرة نفسها - السمة في كل عقدة والفروع وتنبؤات الأوراق - ناتج متعلم. المعامل الفائق (Hyperparameter) نختاره قبل التدريب ونضبطه على بيانات التحقق؛ مثل max_depth أو الحد الأدنى للمعلومات أو قواعد التقليم.
2) الفصل البسيط (Holdout) ليس تحققاً متقاطعاً (Cross-Validation)
في كل تدريب منفرد تُستخدم نصف البيانات، لكن holdout يبني نموذجاً واحداً ويتعلق بنتيجة تقسيم واحد. أما 2-fold CV فيبني نموذجين: مرة ندرب على A ونحقق على B، ثم نعكسهما، وكل مثال يدرب مرة ويحقق مرة، ثم نأخذ المتوسط.
بعد اختيار الإعدادات نعيد التدريب على بيانات التطوير كلها، ثم نفتح مجموعة اختبار مستقلة مرة واحدة.
3) الموجب الكاذب (False Positive, FP) والسالب الكاذب (False Negative, FN)
تنبأ موجباً والحقيقة سالبة. تقليله أهم عندما تكون كلفة الإنذار عالية، مثل رفض دفعة سليمة. نراقب precision وspecificity.
تنبأ سالباً والحقيقة موجبة. تقليله أهم عندما يكون الفقد خطيراً، مثل عدم كشف مريض. نراقب recall.
Precision = TP/(TP+FP)Recall = TP/(TP+FN)Specificity = TN/(TN+FP)خفض عتبة القرار (Decision Threshold) يجعل إعلان «موجب» أسهل؛ فينخفض FN عادةً ويزداد FP. لذلك لا توجد عتبة مثالية لكل التطبيقات: نختارها وفق كلفة الخطأ، لا وفق Accuracy وحدها.
4) انتقاء السمات (Feature Selection)
الانتقاء المشرف (Supervised Feature Selection) يرى الوسم ويقيس الصلة بالخرج؛ الانتقاء غير المشرف (Unsupervised Feature Selection) لا يرى الوسم ويعتمد مثلاً على التباين أو التكرار. للمهمة المحددة يكون المشرف غالباً أنفع، لكنه قد يفرط في الملاءمة (Overfitting) أو يفوّت تفاعلاً مثل XOR إذا قيّم كل سمة وحدها. لذلك يُتعلم الانتقاء داخل الجزء التدريبي من كل طية.
مثال يوضح الفرق: قد تختار الطريقة غير المشرفة سمة عالية التباين لكنها لا تساعد في توقع الوسم، بينما يفضّل الانتقاء المشرف سمة أقل تبايناً تفصل الفئات بوضوح. غير المشرف مفيد عندما لا توجد وسوم أو عندما نريد تمثيلاً عاماً؛ المشرف أنسب عندما يكون هدف التصنيف محدداً والوسوم متاحة.






