Arabic:التعلم الآلي

التعلم الآلي
مقدمة
التعلم الآلي فرع من الذكاء الاصطناعي يركز على بناء نماذج تستخلص أنماطاً من البيانات لكي تنفذ مهمة تنبؤية أو وصفية من دون كتابة قاعدة يدوية لكل حالة. عندما تدرب نموذجاً للتصنيف، مثلاً، فأنت لا تكتب بنفسك قواعد تفصل كل فئة، بل تقدم أمثلة وخصائص وهدفاً، ثم تسمح لخوارزمية التعلم بتقدير المعلمات التي تحقق أداءً جيداً على بيانات لم ترها من قبل.
هذه الدورة موجهة إلى طلبة الجامعة ومتعلمي التعليم العالي. وستتعلم فيها الفرق بين التعلم الخاضع للإشراف والتعلم غير الخاضع للإشراف، وكيف تنتقل من البيانات الخام إلى نموذج مدرب، وكيف تقيمه، ولماذا قد ينجح على بيانات التدريب ثم يفشل في العالم الحقيقي بسبب فرط التخصيص. كما ستنفذ أمثلة برمجية بلغة Python، وتتعامل مع مجموعات بيانات معيارية، وتناقش تطبيقات عملية ومسائل المسؤولية العلمية.
المعارف المسبقة المفيدة هي أساسيات الإحصاء، والجبر الخطي، وقراءة الرسوم البيانية، ومبادئ البرمجة بلغة Python. لا يلزم أن تكون قد درست التعلم الآلي سابقاً.
أهداف التعلم
بعد إكمال الدورة ينبغي أن تكون قادراً على أن:
- تميز بين مسائل التصنيف والانحدار والتجميع وتختار الصياغة المناسبة للمشكلة.
- تشرح دور السمات والهدف والعينات ومجموعات التدريب والتحقق والاختبار.
- تبني خط أنابيب بسيطاً لتدريب نموذج باستخدام Python ومكتبة scikit-learn.
- تقيم نماذج التصنيف باستخدام الدقة والإحكام والاستدعاء ودرجة F1 ومصفوفة الالتباس.
- تقيم نماذج الانحدار باستخدام متوسط الخطأ المطلق ومتوسط مربع الخطأ ومعامل التحديد.
- تفسر التحقق المتقاطع وتستخدمه عند مقارنة النماذج أو ضبط المعلمات الفائقة.
- تكشف إشارات فرط التخصيص ونقص التخصيص وتسمي استراتيجيات للحد منهما.
- تناقش القيود العملية مثل جودة البيانات وعدم التوازن والانحياز وتسرب البيانات وانجراف التوزيع.
- تقارن بين خوارزميات خاضعة وغير خاضعة للإشراف في سياقات تطبيقية واقعية.
من البيانات إلى نموذج قابل للتعميم
تبدأ أغلب مشروعات التعلم الآلي بصياغة السؤال قبل اختيار الخوارزمية. اسأل: ما وحدة الملاحظة؟ ما المتغير الذي نريد التنبؤ به أو النمط الذي نريد اكتشافه؟ ما القيود الأخلاقية والقانونية؟ وكيف سنعرف أن النموذج مفيد بالفعل؟ إن دقة النموذج وحدها لا تكفي إذا كانت البيانات غير ممثلة للسكان المستهدفين أو إذا كان الاستخدام نفسه غير مناسب.
نسمي كل صف في مجموعة البيانات عينة، وكل متغير يدخل إلى النموذج سمة. في التعلم الخاضع للإشراف يوجد أيضاً هدف أو تسمية معروفة أثناء التدريب. يمثل النموذج دالة تحول السمات إلى تنبؤ، بينما تمثل دالة الفقد مقدار الخطأ الذي نريد تقليله. عملية التدريب هي تقدير معلمات النموذج بحيث ينخفض الفقد على بيانات التدريب مع الحفاظ على القدرة على التعميم.
يمكن تمثيل سير العمل بهذا المخطط النصي:
بيانات خام ← فحص الجودة ← تنظيف وترميز ← تقسيم البيانات ← تدريب ← تحقق وضبط ← اختبار نهائي ← نشر ومراقبة
لا ينبغي أن تنتقل معلومات من مجموعة الاختبار إلى مراحل التدريب أو اختيار السمات أو ضبط المعلمات، لأن ذلك يؤدي إلى تسرب البيانات ويعطي تقديراً متفائلاً مضللاً للأداء.
مجموعات بيانات معيارية للتعلم والتجريب
مكتبة scikit-learn توفر مجموعات صغيرة ومدروسة مناسبة للتعليم، كما توفر أدوات لجلب مجموعات أكبر. من الأمثلة المفيدة:
| مجموعة البيانات | نوع المهمة | الحجم | سمات تعليمية مهمة |
|---|---|---|---|
| Iris | تصنيف متعدد الفئات | 150 عينة و4 سمات و3 فئات | مثال كلاسيكي لفهم السمات والحدود الفاصلة والتجميع |
| Breast Cancer Wisconsin Diagnostic | تصنيف ثنائي | 569 عينة و30 سمة | مناسبة لدراسة المقاييس وعدم الاكتفاء بالدقة؛ استخدامها تعليمي وليس أساساً لقرار طبي |
| Digits | تصنيف صور أرقام | 1797 عينة و64 سمة | كل عينة صورة صغيرة بحجم 8×8 بعد تسطيحها إلى سمات |
| California Housing | انحدار | 20640 عينة و8 سمات | مناسبة لتوضيح تنبؤ قيمة عددية وفحص خطأ الانحدار |
يمكنك الرجوع إلى دليل مجموعات البيانات في scikit-learn وإلى الدورة المكثفة في التعلم الآلي من Google كمصادر تعليمية إضافية.

الصورة توضح أن بعض أزواج السمات تفصل فئة Iris setosa بسهولة أكبر من فصل الفئتين الأخريين. هذا مثال على أهمية الاستكشاف البصري قبل التدريب، لكنه لا يغني عن تقييم كمي على بيانات غير مستخدمة في التدريب.
التعلم الخاضع للإشراف
في التعلم الخاضع للإشراف تتكون أمثلة التدريب من سمات X وأهداف y معروفة. الهدف هو تعلم علاقة تساعد على التنبؤ بقيمة y لعينة جديدة. ينقسم هذا النمط غالباً إلى التصنيف عندما يكون الهدف فئة منفصلة، والانحدار عندما يكون الهدف قيمة عددية مستمرة.
الفيديو يشرح الفرق العام بين التعلم الخاضع للإشراف وغير الخاضع للإشراف. أثناء المشاهدة ركز على طبيعة الإشارة التعليمية: وجود هدف معلوم من عدمه، وليس على اسم الخوارزمية فقط.
التصنيف
في التصنيف قد يكون الهدف ثنائياً، مثل اكتشاف رسالة مزعجة أو غير مزعجة، أو متعدد الفئات، مثل التعرف إلى نوع زهرة. ومن الخوارزميات الشائعة الانحدار اللوجستي وأشجار القرار والغابات العشوائية وآلات المتجهات الداعمة والشبكات العصبية. لا توجد خوارزمية أفضل لكل المسائل؛ الاختيار يعتمد على حجم البيانات وبنيتها وقابلية التفسير وزمن الاستدلال وقيود التطبيق.
إذا كان النموذج يعيد احتمالاً، مثل احتمال انتماء العينة إلى الفئة الإيجابية، فإن اختيار عتبة القرار يحول الاحتمال إلى فئة. تغيير العتبة يغير عادة التوازن بين الإحكام والاستدعاء، ولذلك يجب اختيارها وفق تكلفة الأخطاء في المجال وليس وفق رقم اعتباطي.
الانحدار
في الانحدار نتنبأ بقيمة عددية، مثل استهلاك الطاقة أو زمن التسليم. النموذج الخطي يفترض علاقة خطية تقريبية بين السمات والهدف، وهو مفيد كنقطة أساس بسبب بساطته وقابليته للتفسير. النماذج الأكثر مرونة قد تمثل علاقات غير خطية، لكنها قد تحتاج إلى بيانات أكثر وضبط أدق لتجنب فرط التخصيص.

في أبسط حالة خطية، يكتب التنبؤ على صورة ŷ = b + wx. يقدر التدريب المعاملين b وw بحيث يصغر خطأ التنبؤ وفق دالة فقد مثل متوسط مربع الخطأ. في النماذج متعددة السمات يصبح لكل سمة معامل خاص بها.
مثال برمجي: تصنيف Iris
المثال الآتي يقسم البيانات إلى تدريب واختبار، ثم يوحد مقياس السمات داخل خط أنابيب ويعلم نموذج انحدار لوجستي. وجود التحويل والنموذج في خط أنابيب يساعد على منع تطبيق التحويل على كامل البيانات قبل التقسيم.
from sklearn.datasets import load_iris
from sklearn.model_selection import train_test_split
from sklearn.pipeline import make_pipeline
from sklearn.preprocessing import StandardScaler
from sklearn.linear_model import LogisticRegression
from sklearn.metrics import accuracy_score, classification_report
X, y = load_iris(return_X_y=True)
X_train, X_test, y_train, y_test = train_test_split(
X, y, test_size=0.25, random_state=42, stratify=y
)
model = make_pipeline(
StandardScaler(),
LogisticRegression(max_iter=1000)
)
model.fit(X_train, y_train)
pred = model.predict(X_test)
print("الدقة:", accuracy_score(y_test, pred))
print(classification_report(y_test, pred))
لا تحفظ الرقم الناتج بوصفه حقيقة عامة عن الخوارزمية؛ فهو يعتمد على التقسيم وإعدادات النموذج والبيانات. الهدف التعليمي هو فهم التسلسل: تحميل، تقسيم، تحويل، تدريب، تنبؤ، تقييم.
التعلم غير الخاضع للإشراف
في التعلم غير الخاضع للإشراف لا توجد تسمية هدف معروفة لكل عينة أثناء التدريب. نبحث بدلاً من ذلك عن بنية داخل البيانات، مثل مجموعات متشابهة أو تمثيل أقل أبعاداً أو حالات شاذة. ولذلك لا يصح تقييم هذه النماذج دائماً بالطريقة نفسها المستخدمة في التصنيف الخاضع للإشراف.
من أهم المهام التجميع، حيث تقسم الخوارزمية العينات إلى مجموعات وفق تشابه معين. خوارزمية K-means تختار عدداً K من المراكز ثم تكرر إسناد النقاط إلى أقرب مركز وتحديث المراكز حتى الاستقرار. تفترض الخوارزمية ضمنياً أن المسافة ذات معنى وأن المجموعات يمكن تمثيلها جيداً بمراكز، ولهذا قد تفشل عندما تكون المجموعات غير كروية أو مختلفة الكثافة أو شديدة الحساسية للمقياس.

عند تطبيق K-means يجب غالباً توحيد مقياس السمات لأن المسافات تتأثر بوحدات القياس. كذلك لا يعني وجود ثلاثة أنواع معروفة في Iris أن ضبط K على ثلاثة يجعل الخوارزمية تستعيد الأنواع الحقيقية تماماً؛ التجميع يكتشف بنية هندسية، بينما الفئات البيولوجية معرفة خارج الخوارزمية.
مثال برمجي: تجميع Iris من دون استخدام التسميات
from sklearn.datasets import load_iris
from sklearn.preprocessing import StandardScaler
from sklearn.cluster import KMeans
from sklearn.metrics import silhouette_score
X, _ = load_iris(return_X_y=True)
X_scaled = StandardScaler().fit_transform(X)
clusterer = KMeans(n_clusters=3, n_init="auto", random_state=42)
clusters = clusterer.fit_predict(X_scaled)
print("معامل السيلويت:", silhouette_score(X_scaled, clusters))
معامل السيلويت يقيس مدى تماسك العينة مع مجموعتها مقارنة بأقرب مجموعة أخرى. لكنه لا يثبت أن المجموعات ذات معنى علمي أو اجتماعي؛ التفسير يحتاج إلى معرفة بالمجال وفحص حساسية النتائج لخيارات القياس وK والتهيئة.
تدريب النموذج وضبطه
يتضمن التدريب عادة ثلاثة أنواع من الكميات. المعلمات يتعلمها النموذج من البيانات، مثل أوزان النموذج الخطي. المعلمات الفائقة يحددها الباحث أو إجراء الضبط، مثل عمق شجرة القرار أو قوة الانتظام. أما المقاييس فهي أعداد تستخدم لتقييم الأداء ولا ينبغي الخلط بينها وبين دالة الفقد المستخدمة أثناء التدريب.
في خوارزميات كثيرة نبحث عن معلمات تقلل دالة الفقد. يمكن أن يحدث ذلك بحل تحليلي أو بخوارزمية تحسين تكرارية مثل الانحدار التدرجي. في كل خطوة نحسب اتجاهاً يخفض الفقد تقريباً، ثم نحدث المعلمات وفق معدل تعلم. إذا كان المعدل صغيراً جداً يصبح التعلم بطيئاً، وإذا كان كبيراً جداً قد يتذبذب التدريب أو يفشل في الاستقرار.
من الممارسات المهمة إعداد خط أساس بسيط قبل استخدام نموذج معقد. قد يكون الخط الأساس متوسط الهدف في الانحدار أو الفئة الأكثر شيوعاً في التصنيف. إذا لم يتفوق النموذج على خط أساس مناسب، فتعقيده لا يضيف قيمة.
تقسيم التدريب والتحقق والاختبار
مجموعة التدريب تستخدم لتقدير معلمات النموذج. مجموعة التحقق تساعد في اختيار النموذج وضبط المعلمات الفائقة. مجموعة الاختبار يجب أن تبقى معزولة قدر الإمكان حتى نهاية التطوير للحصول على تقدير غير منحاز تقريباً لأداء النموذج على بيانات جديدة.
عندما تكون البيانات محدودة يمكن استخدام التحقق المتقاطع. في تحقق K-fold تقسم بيانات التطوير إلى K طيات، ويدرب النموذج عدة مرات بحيث تستخدم كل طية للتحقق مرة. ثم تجمع النتائج للحصول على تقدير أكثر استقراراً ومقارنة بدائل متعددة.
التحقق المتقاطع لا يحل جميع المشكلات. في بيانات الزمن يجب احترام ترتيب الزمن، وفي البيانات التي تحتوي على عدة سجلات للشخص أو الكيان نفسه يجب منع تسرب الكيان بين التدريب والتحقق، وإلا حصلت على أداء متفائل.
تقييم النماذج
اختيار المقياس جزء من تعريف المهمة. اسأل دائماً: ما نوع الخطأ المكلف؟ هل الفئات متوازنة؟ هل نحتاج تقدير احتمال موثوقاً أم فئة فقط؟ وهل البيانات المستهدفة تشبه بيانات الاختبار؟
تقييم التصنيف ومصفوفة الالتباس
في التصنيف الثنائي تلخص مصفوفة الالتباس أربعة أنواع من النتائج: موجب صحيح، موجب كاذب، سالب صحيح، سالب كاذب. انطلاقاً منها نحسب مقاييس متعددة:
- الدقة: نسبة جميع التنبؤات الصحيحة إلى عدد العينات.
- الإحكام: من الحالات التي تنبأ النموذج بأنها موجبة، كم حالة كانت موجبة فعلاً؟
- الاستدعاء: من جميع الحالات الموجبة فعلاً، كم حالة اكتشفها النموذج؟
- درجة F1: متوسط توافقي يجمع الإحكام والاستدعاء في قيمة واحدة عندما نحتاج موازنة بينهما.
إذا كانت الفئة الإيجابية نادرة جداً، فقد تبدو الدقة مرتفعة حتى لنموذج يتجاهلها. لذلك يجب فحص مصفوفة الالتباس ومقاييس الفئات المهمة وعدم الاعتماد على رقم واحد.
تقييم الانحدار
من المقاييس الشائعة:
- متوسط الخطأ المطلق MAE: متوسط القيم المطلقة للفروق بين القيم الحقيقية والمتنبأ بها، وهو سهل التفسير بوحدة الهدف.
- متوسط مربع الخطأ MSE: يعطي وزناً أكبر للأخطاء الكبيرة بسبب التربيع.
- الجذر التربيعي لمتوسط مربع الخطأ RMSE: يعيد المقياس إلى وحدة الهدف الأصلية.
- معامل التحديد R²: يقارن مقدار التباين الذي يفسره النموذج بخط أساس يعتمد على المتوسط، وقد يكون سالباً على بيانات الاختبار إذا كان النموذج أسوأ من ذلك الخط الأساس.
لا تقارن قيمة MAE بين مشكلتين بوحدات مختلفة من دون سياق. ويجب تحليل بواقي النموذج، لأن متوسطاً جيداً قد يخفي أخطاء منهجية في مناطق محددة من فضاء البيانات.
فرط التخصيص ونقص التخصيص والتعميم
فرط التخصيص يحدث عندما يتعلم النموذج تفاصيل وضوضاء خاصة ببيانات التدريب على حساب الأنماط التي تتكرر في بيانات جديدة. الإشارة الشائعة هي انخفاض خطأ التدريب بينما يبقى خطأ التحقق مرتفعاً أو يبدأ بالازدياد. أما نقص التخصيص فيحدث عندما يكون النموذج أو تمثيل البيانات أبسط من أن يلتقط البنية المهمة، فيكون الأداء ضعيفاً على التدريب والتحقق معاً.

للتقليل من فرط التخصيص يمكن استخدام بيانات أكثر تمثيلاً، وتبسيط النموذج، وإضافة انتظام يعاقب التعقيد، وإيقاف التدريب مبكراً في النماذج التكرارية، واستخدام تحقق متقاطع، وتقليل عدد السمات أو اختيارها بطريقة صحيحة داخل طيات التدريب. لكن لا توجد وصفة واحدة؛ يجب أن تربط الاستراتيجية بمصدر المشكلة.
التعميم هو الهدف المركزي: ما يهم ليس حفظ أمثلة التدريب بل تقديم تنبؤات مفيدة على حالات مستقبلية مأخوذة من التوزيع المستهدف. لذلك يجب أن يمثل الاختبار الواقع الذي سيعمل فيه النظام قدر الإمكان.
مثال عملي متكامل: مقارنة نموذجين
يوضح المثال التالي كيف نقارن نموذجاً خطياً بسيطاً بشجرة قرار على مجموعة تصنيف، مع تحقق متقاطع. المهم ليس الحصول على أفضل رقم في هذا المثال، بل بناء عادة المقارنة المنهجية.
from sklearn.datasets import load_breast_cancer
from sklearn.model_selection import cross_val_score
from sklearn.pipeline import make_pipeline
from sklearn.preprocessing import StandardScaler
from sklearn.linear_model import LogisticRegression
from sklearn.tree import DecisionTreeClassifier
X, y = load_breast_cancer(return_X_y=True)
linear_model = make_pipeline(
StandardScaler(),
LogisticRegression(max_iter=2000)
)
tree_model = DecisionTreeClassifier(max_depth=4, random_state=42)
for name, model in [("نموذج خطي", linear_model), ("شجرة قرار", tree_model)]:
scores = cross_val_score(model, X, y, cv=5, scoring="f1")
print(name, "متوسط F1 =", scores.mean())
هذه المجموعة مرتبطة بمجال طبي، ولذلك يجب التعامل معها هنا باعتبارها مثالاً تعليمياً على التصنيف والمقاييس فقط. لا يجوز تحويل نموذج تدريبي بسيط إلى أداة تشخيص أو قرار سريري من دون تحقق سريري ومنهجي وتنظيمي مناسب.
تطبيقات عملية ومسؤولية علمية
يستخدم التعلم الآلي في توصية المحتوى والمنتجات، والتنبؤ بالطلب، واكتشاف الاحتيال، وتحليل الصور، ومعالجة اللغة الطبيعية، والصيانة التنبؤية، واكتشاف الشذوذ، ودعم البحث العلمي. لكل تطبيق بنية بيانات ومقياس نجاح مختلفان، لذلك تبدأ الهندسة الجيدة من المهمة والسياق لا من الخوارزمية الأكثر شهرة.

عند الانتقال من المختبر إلى الاستخدام الفعلي، راقب انجراف البيانات وانجراف المفهوم. قد تتغير خصائص المدخلات أو العلاقة بين المدخلات والهدف بمرور الزمن، فيتراجع الأداء حتى إذا لم يتغير الكود. لذلك تحتاج الأنظمة الإنتاجية إلى مراقبة، وإعادة تقييم دورية، وسجل واضح لإصدارات البيانات والنماذج.
ينبغي كذلك فحص الإنصاف والخصوصية وقابلية التفسير عند الحاجة. قد يلتقط النموذج ارتباطات تعكس تحيزاً تاريخياً أو متغيرات بديلة لسمات حساسة. التقييم المسؤول يقارن الأداء بين مجموعات ذات صلة بالمجال، ويتحقق من شرعية جمع البيانات، ويحدد أين يلزم تدخل بشري. لا تجعل الأتمتة غاية في ذاتها؛ أحياناً يكون الحل الإحصائي البسيط أو القاعدة الواضحة أكثر أماناً وشفافية.
استراتيجيات دراسة وبحث
لكي تتعلم التعلم الآلي بعمق، لا تكتف بقراءة التعريفات. كرر دورة صغيرة: صغ سؤالاً، استكشف البيانات، ضع خط أساس، درب نموذجاً، افحص الأخطاء، غيّر فرضية واحدة فقط، ثم وثق ما تغير ولماذا. احفظ نتائج التجارب مع البذرة العشوائية وتقسيم البيانات وإصدار المكتبة حتى تكون المقارنة قابلة للتكرار.
عند قراءة ورقة بحثية اسأل: ما مجموعة البيانات؟ كيف قسمت؟ ما خط الأساس؟ هل ضُبطت النماذج بالميزانية نفسها؟ هل توجد فترات ثقة أو تكرارات؟ وهل المقياس المختار يعكس الاستخدام الحقيقي؟ هذه الأسئلة تحول قراءة النتائج من متابعة الأرقام إلى تقييم منهجي للاستدلال.
مهام تفاعلية
اختبار: اختبر معرفتك
ما السمة الأساسية للتعلم الخاضع للإشراف؟ (توجد أهداف أو تسميات معروفة لأمثلة التدريب) (!توجد دائماً ثلاثة تجمعات فقط) (!لا تستخدم أي بيانات أثناء التدريب) (!لا يمكنه معالجة القيم العددية)
أي مهمة تعد مثالاً نموذجياً على الانحدار؟ (التنبؤ بقيمة عددية مستمرة) (!إسناد صورة إلى فئة حيوان) (!تقسيم العملاء إلى مجموعات بلا تسميات) (!اكتشاف المكونات الرئيسية فقط)
ما الهدف المباشر لخوارزمية K-means؟ (تكوين مجموعات حول مراكز وفق المسافة) (!تقدير احتمال فئة من تسميات معروفة) (!حساب دقة اختبار نهائية تلقائياً) (!إزالة جميع القيم المفقودة)
لماذا تستخدم مجموعة تحقق منفصلة؟ (لاختيار النموذج وضبط المعلمات الفائقة) (!لاستبدال بيانات التدريب بالكامل) (!لإعطاء النموذج الإجابات أثناء الاختبار) (!لضمان أن الدقة تساوي مئة بالمئة)
أي نمط يشير غالباً إلى فرط التخصيص؟ (أداء ممتاز على التدريب وأضعف بوضوح على التحقق) (!أداء ضعيف ومتشابه على التدريب والتحقق) (!عدم وجود أي معلمات في النموذج) (!زيادة عدد عينات الاختبار وحدها)
ماذا يقيس الإحكام في التصنيف الثنائي؟ (نسبة الموجبات الصحيحة بين الحالات المتنبأ بأنها موجبة) (!نسبة الموجبات المكتشفة من جميع الموجبات الحقيقية) (!متوسط مربع أخطاء الانحدار) (!عدد السمات في مجموعة البيانات)
ماذا يقيس الاستدعاء؟ (نسبة الموجبات التي اكتشفها النموذج من جميع الموجبات الحقيقية) (!نسبة الموجبات الصحيحة بين جميع التنبؤات الموجبة فقط) (!الفرق بين متوسط التدريب ومتوسط الاختبار) (!عدد طيات التحقق المتقاطع)
ما فائدة التحقق المتقاطع؟ (تقدير الأداء عبر تقسيمات متعددة ومقارنة البدائل بصورة أكثر استقراراً) (!ضمان أن النموذج لن يخطئ بعد النشر) (!تحويل كل مسألة إلى تعلم غير خاضع للإشراف) (!إلغاء الحاجة إلى بيانات ممثلة)
ما وظيفة الانتظام في كثير من النماذج؟ (الحد من التعقيد لتقليل خطر فرط التخصيص) (!زيادة عدد الفئات تلقائياً) (!استبدال جميع السمات بقيمة واحدة) (!استخدام مجموعة الاختبار داخل التدريب)
ما المثال الأقرب إلى تسرب البيانات؟ (استخدام معلومات من مجموعة الاختبار أثناء اختيار السمات) (!تثبيت بذرة عشوائية لتكرار التجربة) (!قياس الاستدعاء بعد التنبؤ على الاختبار) (!توثيق إصدار مكتبة التعلم الآلي)
لعبة الذاكرة
| التصنيف | التنبؤ بفئة منفصلة من أمثلة موسومة |
| الانحدار | التنبؤ بقيمة عددية مستمرة |
| التجميع | اكتشاف مجموعات متشابهة من دون هدف معروف |
| مجموعة التدريب | البيانات المستخدمة لتقدير معلمات النموذج |
| مجموعة التحقق | البيانات المستخدمة لمقارنة النماذج وضبط المعلمات الفائقة |
| مجموعة الاختبار | البيانات المعزولة لتقدير الأداء النهائي |
| التعميم | قدرة النموذج على الأداء الجيد في بيانات جديدة |
السحب والإفلات
| طابق كل مفهوم مع الوصف الصحيح. | التعلم الآلي |
|---|---|
| التعلم الخاضع للإشراف | يتعلم من أمثلة تحتوي على أهداف معروفة |
| التعلم غير الخاضع للإشراف | يبحث عن بنية في بيانات بلا أهداف معروفة |
| الدقة | نسبة جميع التنبؤات الصحيحة |
| الإحكام | جودة التنبؤات التي أعلنها النموذج موجبة |
| الاستدعاء | نسبة الحالات الموجبة الحقيقية التي اكتشفها النموذج |
| الانتظام | إضافة قيد أو عقوبة للحد من تعقيد النموذج |
كلمات متقاطعة
| تصنيف | ما المهمة التي تتنبأ بفئة منفصلة؟ |
| انحدار | ما المهمة التي تتنبأ بقيمة عددية مستمرة؟ |
| تجميع | ما الأسلوب الذي يجمع العينات المتشابهة بلا تسميات؟ |
| تحقق | ما العملية التي نستخدمها لتقدير الأداء أثناء اختيار النموذج؟ |
| تعميم | ما القدرة التي تعني نجاح النموذج على بيانات جديدة؟ |
| انتظام | ما الأسلوب الذي يقيد تعقيد النموذج للحد من فرط التخصيص؟ |
مهام مفتوحة
سهل
- خريطة مفاهيم للتعلم الآلي: أنشئ خريطة مفاهيم تربط البيانات والسمات والهدف والنموذج والفقد والتقييم، واكتب مثالاً قصيراً لكل مفهوم.
- استكشاف مجموعة Iris: حمّل مجموعة Iris في Python، واعرض أسماء السمات وأبعاد البيانات وتوزيع الفئات، ثم اكتب خمس ملاحظات مبنية على النتائج.
- مقارنة مقاييس التصنيف: صمم أربع حالات افتراضية لمصفوفة التباس، واحسب الدقة والإحكام والاستدعاء يدوياً، ثم فسّر لماذا تختلف دلالة كل مقياس.
- فيديو شرح قصير: سجل فيديو أكاديمياً من دقيقتين إلى ثلاث دقائق تشرح فيه الفرق بين التصنيف والانحدار والتجميع باستخدام أمثلة من تخصصك، من دون تضمين بيانات شخصية.
متوسط
- تجربة خط أساس: اختر مجموعة بيانات تصنيف من scikit-learn، وقارن نموذجاً بسيطاً بخط أساس، ووثق التقسيم والمقياس والنتائج في تقرير قصير.
- مختبر K-means: طبق K-means على بيانات معيارية بعد التوحيد، وجرّب قيماً مختلفة لـ K، وارسم النتائج أو لخصها، ثم ناقش متى يبدو التجميع ذا معنى ومتى لا يبدو كذلك.
- دراسة فرط التخصيص: درب أشجار قرار بأعماق متزايدة، وقارن أداء التدريب والتحقق، وأنشئ رسماً بيانياً يوضح الانتقال من نقص التخصيص إلى فرط التخصيص.
- مقابلة مهنية: أجر مقابلة قصيرة مع باحث أو محلل بيانات أو مهندس تعلم آلي حول كيفية تقييم النماذج في عمله، ثم لخص المنهجية مع تجنب أي معلومات سرية أو شخصية.
متقدم
- دراسة تحقق متقاطع: صمم تجربة تقارن ثلاثة نماذج على مجموعة بيانات واحدة باستخدام التحقق المتقاطع نفسه، وأبلغ عن المتوسط والتشتت وميزانية الضبط لكل نموذج.
- تحليل تسرب البيانات: أنشئ مثالاً برمجياً آمناً يوضح كيف يرفع تسرب البيانات الأداء الظاهري، ثم أصلح خط الأنابيب واشرح سبب الفرق بين النتيجتين.
- تدقيق إنصاف نموذج: اختر مجموعة بيانات عامة مناسبة، وحدد متغيرات سياقية ذات صلة، وافحص فروق الأداء بين مجموعات فرعية مع مناقشة حدود الاستنتاج وعدم اختزال الإنصاف في مقياس واحد.
- مشروع بحث تطبيقي: صغ سؤالاً من تخصصك يمكن دراسته بالتعلم الآلي، وحدد البيانات وخط الأساس والمقاييس وخطة التحقق ومخاطر الخصوصية والانحياز، ثم نفذ نموذجاً أولياً واكتب مناقشة نقدية للنتائج.
مجالات تعلم مرتبطة
يرتبط التعلم الآلي بالإحصاء لأن التقدير وعدم اليقين والتعميم مفاهيم إحصائية أساسية، وبالجبر الخطي لأن البيانات والمعلمات غالباً تمثل بمتجهات ومصفوفات، وبالتحسين لأن التدريب يبحث عن معلمات تقلل دالة فقد. كما يتقاطع مع هندسة البرمجيات عند نشر النماذج ومراقبتها، ومع أخلاقيات التقنية عند التعامل مع الخصوصية والإنصاف والمساءلة.
مسرد
| المصطلح | التعريف |
|---|---|
| عينة | ملاحظة واحدة تمثل صفاً أو حالة في مجموعة البيانات. |
| سمة | متغير يدخل إلى النموذج بوصفه معلومة متاحة للتنبؤ أو التحليل. |
| هدف | القيمة أو الفئة التي يتعلم النموذج الخاضع للإشراف التنبؤ بها. |
| معلمة | قيمة داخلية يتعلمها النموذج من بيانات التدريب. |
| معلمة فائقة | إعداد يحدد قبل التدريب أو يضبط بإجراء منفصل مثل عمق الشجرة. |
| دالة الفقد | كمية رياضية تقيس خطأ النموذج وتوجه عملية التدريب. |
| التحقق المتقاطع | إجراء يعيد تقسيم بيانات التطوير إلى طيات متعددة لتقدير الأداء ومقارنة النماذج. |
| فرط التخصيص | تعلم تفاصيل خاصة ببيانات التدريب بما يضعف الأداء على البيانات الجديدة. |
| نقص التخصيص | فشل نموذج بسيط أو تمثيل غير كاف في التقاط البنية المهمة حتى على بيانات التدريب. |
| التعميم | قدرة النموذج على الحفاظ على أداء جيد عند التعامل مع بيانات جديدة من التوزيع المستهدف. |
| تسرب البيانات | دخول معلومات غير متاحة فعلياً وقت التنبؤ أو من مجموعة الاختبار إلى عملية التدريب أو الاختيار. |
| الانتظام | تقنية تحد من تعقيد النموذج أو تعاقبه لتقليل خطر فرط التخصيص. |
| انجراف البيانات | تغير توزيع المدخلات مع الزمن مقارنة بالبيانات التي درب عليها النموذج. |
مشروعات aiMOOC
NEWSLernweltNOAH fragen