Zum Inhalt springen

Arabic:الرؤية الحاسوبية

Aus MOOCsWiki Staging
Die Druckversion wird nicht mehr unterstützt und kann Darstellungsfehler aufweisen. Bitte aktualisiere deine Browser-Lesezeichen und verwende stattdessen die Standard-Druckfunktion des Browsers.
aiMOOC-Siegel

الرؤية الحاسوبية



مقدمة

الرؤية الحاسوبية مجال من مجالات الذكاء الاصطناعي يهدف إلى تمكين الحاسوب من استخراج معلومات مفيدة من الصور والفيديو واتخاذ قرارات مبنية على المحتوى البصري. ستتعلم في هذه الدورة كيف تنتقل من الصورة الخام إلى تمثيل عددي، ثم إلى معالجة مسبقة واستخراج سمات ونماذج تعلم عميق، وصولا إلى التصنيف والكشف والتعرف والتجزئة والتقييم والنشر المسؤول.

الدورة موجهة إلى طلاب الجامعة والمتعلمين في التعليم العالي. يفيد أن تكون لديك معرفة أولية ببرمجة بايثون، والجبر الخطي، والاحتمالات، ومبادئ تعلم الآلة. لا يلزم أن تكون خبيرا في الشبكات العصبية قبل البدء؛ سنبني المفاهيم تدريجيا ونربطها بأمثلة عملية.

الرؤية الحاسوبية ليست مجرد «رؤية مثل الإنسان». النموذج يتعلم أنماطا إحصائية من بيانات محددة، وقد ينجح في اختبار معياري ثم يفشل عند تغير الإضاءة أو الكاميرا أو السكان أو سياق الاستخدام. لذلك سنعامل جودة البيانات والتقييم والخصوصية والإنصاف بوصفها أجزاء أساسية من النظام، لا إضافات جانبية.

مخطط لمسار معالجة صورة رقمية عبر عمليات مترابطة
مخطط يوضح أن معالجة الصورة يمكن تنظيمها كسلسلة من عمليات مترابطة.


أهداف التعلم

  1. تشرح كيف تمثل الصورة الرقمية بالمصفوفات والبكسلات والقنوات اللونية، وكيف تؤثر الدقة والضجيج والإضاءة في التحليل.
  2. تطبق خطوات أساسية في معالجة الصور الرقمية مثل تغيير الحجم والتطبيع والترشيح وكشف الحواف.
  3. تميز بين التصنيف والكشف والتعرف والتجزئة الدلالية وتجزئة المثيلات وتختار المهمة المناسبة للمشكلة.
  4. تفسر دور الالتفاف وتجميع القيم والتمثيلات الهرمية في الشبكات العصبية الالتفافية.
  5. تبني أمثلة برمجية صغيرة لمعالجة الصور والتصنيف باستخدام أدوات شائعة في بايثون.
  6. تختار مقاييس تقييم مناسبة للتصنيف والكشف والتجزئة وتفسر أخطاء النموذج بدلا من الاكتفاء برقم واحد.
  7. تحلل أثر انحياز البيانات والتحيز الخوارزمي وتغير المجال في أداء أنظمة الرؤية الحاسوبية.
  8. تصمم ممارسات تحمي الخصوصية عند جمع الصور وتوسيمها وتخزينها واستخدامها، خاصة في التطبيقات الحساسة.


من الصورة إلى البيانات

الصورة الرقمية مصفوفة من البكسلات. في الصورة الرمادية يمثل كل بكسل شدة ضوئية، أما الصورة الملونة فتستخدم عادة عدة قنوات مثل الأحمر والأخضر والأزرق. أبعاد المصفوفة، ونطاق القيم، وترتيب القنوات، ودقة القياس كلها تؤثر في الخوارزمية. عند قراءة صورة باستخدام مكتبة برمجية يجب أن تعرف هل القيم أعداد صحيحة من 0 إلى 255 أم أعداد حقيقية مطبعة، وهل ترتيب القنوات هو RGB أم ترتيب آخر.

تتضمن المعالجة المسبقة الشائعة تغيير الحجم، وقص مناطق الاهتمام، والتطبيع، وتصحيح الإضاءة، وإزالة بعض أنواع الضجيج. لا توجد خطوة «تنظيف» مثالية لكل المسائل؛ فقد يؤدي التنعيم القوي مثلا إلى إزالة حواف دقيقة يحتاجها النموذج. لذلك يجب تقييم أي معالجة في سياق المهمة النهائية.

مثال برمجي مبسط باستخدام OpenCV:

import cv2

# قراءة الصورة
image = cv2.imread("image.jpg")

# تحويلها إلى تدرج رمادي
gray = cv2.cvtColor(image, cv2.COLOR_BGR2GRAY)

# تقليل ضجيج عالي التردد بمرشح غاوسي
smooth = cv2.GaussianBlur(gray, (5, 5), 0)

# استخراج حواف تقريبية
edges = cv2.Canny(smooth, 100, 200)

هذا المثال يوضح مسارا كلاسيكيا: قراءة الصورة ثم تحويل تمثيلها ثم الترشيح ثم استخراج بنية مثل الحواف. في مشروع حقيقي ينبغي أن تقارن النتائج بصريا وكميا، وأن تسجل إعدادات المعالجة كي تكون التجربة قابلة لإعادة التنفيذ.


= الترشيح والحواف والسمات

المرشح عبارة عن عملية محلية تمر على نافذة صغيرة من الصورة. يمكن لمرشح غاوسي أن يقلل الضجيج، بينما تبرز مرشحات المشتقات التغيرات السريعة في الشدة وتساعد على كشف الحواف. قبل انتشار التعلم العميق كان الباحثون يصممون سمات يدوية مثل التدرجات واتجاهاتها، ثم يمررونها إلى مصنفات تقليدية. لا تزال هذه الأفكار مهمة لفهم ما تفعله الطبقات الالتفافية ولمشروعات صغيرة أو محدودة الموارد.

السمات ليست «حقائق» عن الصورة؛ هي تمثيلات تختارها الخوارزمية. إذا تغيرت ظروف الالتقاط فقد تتغير السمات أيضا. لذلك من المفيد اختبار المتانة أمام الدوران الجزئي، والضبابية، وتغير السطوع، والضغط، والقص.


مجموعات البيانات والتوسيم

تعتمد الرؤية الحاسوبية الحديثة على أمثلة مصورة مع تسميات أو إشارات إشراف. قد تكون التسمية فئة للصورة، أو صندوق إحاطة حول جسم، أو قناعا لكل بكسل، أو نقاطا لمواضع مفصلية. جودة التوسيم تؤثر مباشرة في الحد الأعلى العملي لجودة النموذج؛ فالتسميات المتناقضة أو الغامضة تخلق ضجيجا تعليميا يصعب إصلاحه لاحقا.

من أمثلة مجموعات البيانات التعليمية والبحثية المعروفة:

مجموعة البيانات الاستخدام النموذجي ما الذي تتعلمه منها ملاحظة منهجية
MNIST تصنيف الأرقام المكتوبة بخط اليد فهم خط أنابيب التصنيف وبناء نموذج أولي سريع بسيطة جدا مقارنة بصور العالم الحقيقي، فلا ينبغي اعتبار الأداء عليها دليلا كافيا على الجاهزية للتطبيق
CIFAR-10 تصنيف صور ملونة صغيرة إلى عشر فئات مقارنة النماذج وتجربة زيادة البيانات الدقة المكانية منخفضة، لذلك تختلف تحدياتها عن الصور عالية الدقة
ImageNet تصنيف واسع النطاق وتعلم تمثيلات قابلة للنقل فهم أثر البيانات الكثيرة والتعلم بالنقل تحتوي على تصنيفات وسياقات تحتاج إلى قراءة نقدية عند إعادة الاستخدام
COCO الكشف وتجزئة المثيلات ووصف الصور العمل مع عدة أجسام في المشهد الواحد يجب تحديد النسخة وتقسيمات التدريب والتحقق عند مقارنة النتائج
Cityscapes التجزئة الدلالية لمشاهد الشوارع تقييم فهم المشاهد الحضرية على مستوى البكسل المجال بصري محدد، وقد لا يعمم مباشرة على مدن وكاميرات وطقس مختلف
شبكة من صور أرقام مكتوبة بخط اليد من الصفر إلى التسعة
عينة من صور مجموعة MNIST توضح فكرة البيانات المصورة الموسومة.

عند بناء مجموعة بياناتك اسأل: من يمثلها؟ ومن يغيب عنها؟ ما ظروف الإضاءة والأجهزة؟ هل التوسيم متسق بين المراجعين؟ وهل يملك المشاركون أساسا قانونيا وأخلاقيا واضحا لجمع الصور؟ من المفيد إعداد بطاقة بيانات توثق المصدر، والغرض، والقيود، وتقسيمات التدريب والتحقق والاختبار، والمخاطر المتوقعة.


= زيادة البيانات ومنع تسرب الاختبار

زيادة البيانات تولد تحويرات معقولة مثل القص أو الانعكاس أو تغير محدود في اللون بهدف تحسين التعميم. يجب ألا تغير الزيادة معنى الفئة؛ فالانعكاس قد يكون مناسبا لصورة حيوان لكنه غير مناسب لبعض النصوص أو الرموز الطبية. كذلك يجب منع تسرب البيانات، أي وصول معلومات من مجموعة الاختبار إلى التدريب أو اختيار المعاملات، لأن ذلك يعطي تقديرا متفائلا مضللا للأداء.


التعلم العميق والشبكات العصبية الالتفافية

تتعلم الشبكات العصبية الالتفافية مرشحاتها من البيانات. في الطبقات الأولى قد تستجيب المرشحات لحواف أو قوام بسيط، ثم تتكون تمثيلات أكثر تجريدا في الطبقات اللاحقة. الالتفاف يستفيد من مشاركة الأوزان والاتصال المحلي، ما يقلل عدد المعاملات مقارنة بطبقة كاملة الاتصال على صورة كبيرة ويستفيد من البنية المكانية.

مخطط لشبكة عصبية التفافية تبدأ بصورة ثم طبقات لاستخراج السمات وتنتهي بالتصنيف
بنية نموذجية لشبكة عصبية التفافية تتدرج من الصورة إلى السمات ثم قرار التصنيف.
مثال مرئي يوضح تمرير نواة التفاف على مصفوفة صورة وحساب القيم الناتجة
مثال عملي يوضح فكرة الالتفاف وحساب خريطة السمات.

في الالتفاف تنزلق نواة صغيرة فوق الصورة وتحسب تركيبا خطيا للقيم المحلية. بعد ذلك تستخدم دالة تفعيل لاخطية، وقد تستخدم عملية تجميع لتقليل الأبعاد المكانية. كلما تعمقت الشبكة اتسع المجال الاستقبالي الفعال وأصبح القرار قادرا على دمج معلومات من مساحة أكبر من الصورة.

نموذج تعليمي صغير باستخدام PyTorch:

import torch
from torch import nn

model = nn.Sequential(
    nn.Conv2d(3, 16, kernel_size=3, padding=1),
    nn.ReLU(),
    nn.MaxPool2d(2),
    nn.Conv2d(16, 32, kernel_size=3, padding=1),
    nn.ReLU(),
    nn.AdaptiveAvgPool2d((1, 1)),
    nn.Flatten(),
    nn.Linear(32, 10)
)

هذا النموذج مناسب لفهم البنية وليس وصفة لأفضل أداء. في التطبيقات الفعلية تحتاج أيضا إلى دالة خسارة، ومحسن، وحلقات تدريب وتحقق، وتنظيم، ومراقبة فرط التكيف.

هذه المحاضرة الجامعية باللغة الإنجليزية مناسبة للتعمق في تصنيف الصور والالتفاف والتجميع. استخدمها مع الملاحظات العربية في هذه الدورة، وركز على العلاقة بين التمثيلات المحلية والسمات الأعلى مستوى.


= التعلم بالنقل والمحولات البصرية

في التعلم بالنقل تبدأ غالبا بنموذج سبق تدريبه على مجموعة كبيرة ثم تضبط طبقاته لمهمة جديدة. يفيد ذلك عندما تكون بياناتك محدودة، لكنه لا يلغي ضرورة التحقق من ملاءمة المجال؛ فالتمثيلات المتعلمة من صور عامة قد لا تكون مثالية لصور الأقمار الصناعية أو المجهر مثلا.

إلى جانب الشبكات الالتفافية ظهرت المحولات البصرية التي تمثل الصورة على شكل رقع وتستخدم آليات الانتباه لبناء علاقات بين أجزاء الصورة. الاختيار بين بنية التفاف ومحولة أو بنية هجينة يعتمد على حجم البيانات، والموارد، والزمن المطلوب للاستدلال، وطبيعة المهمة، ولا توجد بنية واحدة متفوقة في كل الظروف.


التصنيف والكشف والتعرف والتجزئة

التصنيف يجيب عادة عن سؤال: ما الفئة الأساسية للصورة أو الرقعة؟ أما الكشف فيحدد الأجسام وفئاتها ومواقعها، غالبا بصناديق إحاطة. والتعرف مصطلح أوسع قد يعني إسناد هوية أو فئة لكيان مرئي. أما التجزئة فتنتقل إلى مستوى البكسل.

في التجزئة الدلالية يحصل كل بكسل على فئة مثل طريق أو مبنى أو شخص، بينما تميز تجزئة المثيلات بين كائنين مختلفين من الفئة نفسها. وقد تجمع أنظمة فهم المشهد بين الكشف والتجزئة وتتبع الأجسام عبر الزمن.

أشخاص في صورة مع صناديق مستطيلة حول الوجوه المكتشفة
مثال على كشف الوجوه باستخدام صناديق إحاطة؛ الكشف يحدد الموضع ولا يعني بالضرورة معرفة الهوية.

من الأخطاء الشائعة الخلط بين كشف الوجه والتعرف على الوجه. الكشف يقرر أين يوجد وجه، أما التعرف فيحاول ربط الوجه بهوية أو قالب معروف، وهو استخدام أكثر حساسية من ناحية الخصوصية والمخاطر.


= تجزئة الصورة

يمكن إجراء تجزئة بسيطة بالاعتماد على اللون أو الشدة، مثل تجميع البكسلات المتشابهة. أما النماذج العميقة فتتعلم خرائط كثيفة من الصور والأقنعة الموسومة. جودة التجزئة لا تقاس بمجرد النظر؛ يجب استخدام مقاييس مثل تقاطع على اتحاد أو معامل دايس، ومراجعة الفئات الصغيرة والحواف الدقيقة على نحو منفصل.

صورة للشفق القطبي بعد تقليل ألوانها إلى أربع مجموعات بواسطة خوارزمية ك متوسطات
مثال بصري على تجميع لوني يمكن استخدامه لفهم الفكرة الأساسية للتجزئة غير الخاضعة للإشراف.

تتناول هذه المحاضرة الجامعية باللغة الإنجليزية الكشف والتجزئة الدلالية وتجزئة المثيلات. عند المشاهدة قارن بين ناتج كل مهمة: فئة واحدة، أو صندوق إحاطة، أو قناع على مستوى البكسل.


تقييم النماذج وتحليل الأخطاء

التقييم الجيد يبدأ بتحديد ما يعنيه النجاح في سياق الاستخدام. في التصنيف قد تكون الدقة مناسبة عندما تكون الفئات متوازنة وتكاليف الأخطاء متقاربة، لكنها قد تكون مضللة عند ندرة الفئة المهمة. عندها يصبح من الضروري النظر إلى الإحكام والاستدعاء ودرجة F1 ومصفوفة الالتباس.

في الكشف نقارن صندوق التنبؤ بصندوق الحقيقة المرجعية باستخدام تقاطع على اتحاد. إذا كان التداخل كبيرا كان التطابق المكاني أفضل. تستخدم مقاييس متوسط الدقة ومتوسط متوسط الدقة لتلخيص الأداء عبر فئات وعتبات مختلفة، لكن يجب دائما ذكر بروتوكول القياس والنسخة المستخدمة من البيانات.

في التجزئة تقيس IoU وDice مقدار التداخل بين القناع المتوقع والقناع المرجعي. أما في التطبيقات الزمنية أو الفورية فيجب إضافة زمن الاستدلال، ومعدل الإطارات، واستهلاك الذاكرة والطاقة، لأن نموذجًا أكثر دقة قد لا يكون الأنسب على جهاز محدود الموارد.

نوع المهمة مقاييس مفيدة سؤال تشخيصي
تصنيف الدقة والإحكام والاستدعاء ودرجة F1 أي الفئات تختلط ببعضها ولماذا؟
كشف تقاطع على اتحاد ومتوسط الدقة ومتوسط متوسط الدقة هل الخطأ في الفئة أم الموقع أم فقدان الجسم؟
تجزئة تقاطع على اتحاد ومعامل دايس هل تتدهور الجودة عند الحدود أو للأجسام الصغيرة؟
نشر فعلي زمن الاستدلال والذاكرة والمعايرة والمتانة هل يبقى الأداء مستقرا عند تغير الكاميرا والبيئة؟

مثال مبسط لحساب تقاطع على اتحاد لصندوقين:

def iou(box_a, box_b):
    # كل صندوق على الصورة: x1, y1, x2, y2
    x_left = max(box_a[0], box_b[0])
    y_top = max(box_a[1], box_b[1])
    x_right = min(box_a[2], box_b[2])
    y_bottom = min(box_a[3], box_b[3])

    inter_w = max(0, x_right - x_left)
    inter_h = max(0, y_bottom - y_top)
    intersection = inter_w * inter_h

    area_a = (box_a[2] - box_a[0]) * (box_a[3] - box_a[1])
    area_b = (box_b[2] - box_b[0]) * (box_b[3] - box_b[1])
    union = area_a + area_b - intersection
    return intersection / union if union > 0 else 0
مقارنة بين حدود الحقيقة المرجعية ونتائج كشف أجسام غير مطابقة تماما
رسم يوضح أن كشف الأجسام قد يخطئ في موضع الصندوق أو حجمه حتى عندما تبدو الفئة صحيحة.


= مصفوفة الالتباس والمعايرة

مصفوفة الالتباس تكشف أين تتركز أخطاء التصنيف. أما المعايرة فتسأل هل تعكس درجة الثقة احتمالا واقعيا للنجاح؛ فإذا كانت التنبؤات ذات ثقة 0.8 صحيحة في نحو ثمان حالات من كل عشر عبر مجموعة مماثلة، تكون المعايرة أفضل من نموذج يعطي ثقة عالية جدا رغم كثرة الأخطاء. المعايرة مهمة عندما تستخدم الثقة لاتخاذ قرار لاحق أو إحالة حالة إلى خبير بشري.

لا يكفي اختبار النموذج مرة واحدة. أنشئ مجموعات اختبار تمثل الظروف الواقعية، واحتفظ باختبار مستقل، وكرر القياس بعد تحديث البيانات أو البرمجيات أو الأجهزة. عند الانتقال إلى بيئة جديدة افحص تغير المجال قبل الاعتماد على النتائج السابقة.


تطبيقات الرؤية الحاسوبية

تستخدم الرؤية الحاسوبية في تحليل الصور الطبية، وفحص المنتجات الصناعية، والزراعة الدقيقة، والاستشعار عن بعد، والروبوتات، والمركبات، ورقمنة الوثائق، والمساعدة على الوصول لذوي الإعاقة، وتحليل الفيديو العلمي. تختلف متطلبات الخطأ من مجال إلى آخر؛ فقد يكون الخطأ المسموح في تصنيف صور ترفيهية مختلفا جذريا عن خطأ في نظام طبي أو نظام سلامة.

في التصوير الطبي مثلا يجب أن يدعم النموذج قرار المختص ضمن بروتوكول سريري، لا أن يفترض أنه بديل كامل عن الخبرة البشرية. وفي الصناعة قد تكون سرعة اكتشاف العيب وحساسية النظام للأعطال أهم من تحسين نسبة صغيرة في مقياس معياري. وفي الاستشعار عن بعد قد تؤثر الدقة المكانية والسحب وتغير المواسم في التعميم.


التحيز والخصوصية والاستخدام المسؤول

قد ينشأ التحيز من جمع البيانات، أو نقص تمثيل مجموعات معينة، أو طريقة التوسيم، أو اختيار الهدف، أو ظروف الاستشعار، أو قرار النشر نفسه. لذلك لا تعالج الإنصاف بمجرد «إزالة سمة حساسة» من جدول؛ فقد تحمل الصورة إشارات بديلة مرتبطة بها. التقييم المسؤول يقيس الأداء الكلي ويفككه حسب الظروف والمجموعات ذات الصلة بالمجال عندما يكون ذلك مشروعا وآمنا.

لا تعني فجوة الأداء تلقائيا أن سببها عامل واحد. قد تكون نتيجة عينة صغيرة، أو كاميرا مختلفة، أو إضاءة، أو تغير في المجال، أو انحياز فعلي في البيانات أو النموذج. المطلوب هو تحقيق منظم: توثيق البيانات، وتدقيق التوزيعات، وتحليل الأخطاء، وإعادة القياس بعينات كافية، ثم اتخاذ إجراء تصحيحي قابل للاختبار.

الصور قد تحتوي على بيانات شخصية أو بيومترية. عند جمعها يجب تطبيق مبادئ تقليل البيانات وتحديد الغرض والاحتفاظ المحدود والتحكم في الوصول. لا تجمع صور الوجوه لمجرد أنها متاحة تقنيا، ولا تعيد استخدام مجموعة صممت لغرض واحد في غرض حساس جديد بلا أساس مناسب. عند الإمكان استخدم إخفاء الهوية أو طمس السمات غير المطلوبة، وافصل بيانات التعريف عن الصور، وسجل من يمكنه الوصول إليها ولماذا.

في مشروعات الجامعة، لا تنشر صور زملائك أو معلوماتهم الشخصية من أجل التدريب دون موافقة واضحة ومتطلبات أخلاقية ملائمة. يمكن تنفيذ معظم التمارين التعليمية ببيانات عامة مخصصة للتعلم أو بصور غير شخصية ينشئها المتعلم بنفسه.


= قائمة فحص قبل النشر

  1. حدد المهمة والقرار الذي سيتأثر بمخرجات النموذج، ومن يتحمل مسؤولية القرار النهائي.
  2. وثق مصدر البيانات وشروط استخدامها ومجموعاتها غير الممثلة جيدا ومشكلات التوسيم المعروفة.
  3. اختر مقاييس مرتبطة بتكلفة الأخطاء، ولا تعتمد على متوسط واحد إذا كانت الأخطاء غير متكافئة.
  4. اختبر المتانة أمام تغير الإضاءة والحجم والجهاز والضغط والبيئة كلما كان ذلك ملائما.
  5. افحص الأداء تفصيليا حسب الفئات والظروف والمجموعات ذات الصلة عندما يكون ذلك قانونيا وأخلاقيا.
  6. ضع حدودا لاستخدام الثقة، وآلية لإحالة الحالات الغامضة إلى مراجعة بشرية في الأنظمة عالية الأثر.
  7. طبق حماية الخصوصية وتقليل البيانات والتحكم في الوصول وخطة حذف أو احتفاظ واضحة.
  8. راقب النموذج بعد النشر لأن توزيع البيانات قد يتغير بمرور الزمن.


مفاهيم وحدود ينبغي تذكرها

أولا: الدقة العالية على مجموعة اختبار واحدة لا تعني الفهم البشري ولا التعميم الشامل. ثانيا: تكبير النموذج لا يصلح بالضرورة مشكلات التوسيم أو انحياز البيانات. ثالثا: صورة تبدو واضحة للإنسان قد تحتوي تحولات في البكسلات أو الضغط تؤثر في النموذج. رابعا: القرار المسؤول يوازن بين الأداء والموارد والخصوصية والإنصاف وقابلية التدقيق.

فكر في أي نظام رؤية حاسوبية كسلسلة مترابطة: تعريف المشكلة، جمع البيانات، التوسيم، المعالجة، التدريب، التحقق، الاختبار، التحليل، النشر، المراقبة. الخطأ في مرحلة مبكرة قد يظهر لاحقا على أنه «مشكلة نموذج» بينما السبب الحقيقي هو البيانات أو تعريف المهمة.


مهام تفاعلية


اختبار: اختبر معرفتك

ما الوصف الأدق للرؤية الحاسوبية؟ (استخراج معلومات قابلة للاستخدام من الصور والفيديو بواسطة أنظمة حاسوبية) (!تخزين الصور فقط دون تحليلها) (!تحويل كل صورة إلى نص من دون نموذج) (!زيادة دقة الشاشة للمستخدم)




لماذا قد نستخدم التطبيع قبل تدريب نموذج على الصور؟ (لجعل نطاق القيم أكثر ملاءمة واستقرارا لعملية التعلم) (!لضمان إزالة جميع الأخطاء من البيانات) (!لتحويل كل الصور إلى فئة واحدة) (!لزيادة عدد الملصقات يدويا)




ما الفكرة الأساسية للطبقة الالتفافية؟ (تطبيق مرشحات محلية مشتركة الأوزان لاستخراج خرائط سمات) (!تخزين نسخة كاملة من الصورة في كل عصبون) (!حذف جميع العلاقات المكانية بين البكسلات) (!استبدال بيانات التدريب باختبار واحد)




ما الذي يميز كشف الأجسام عن تصنيف الصورة؟ (كشف الأجسام يحدد الفئات ومواقع الأجسام داخل الصورة) (!كشف الأجسام لا يستخدم صورا) (!التصنيف يعطي قناعا لكل بكسل دائما) (!التصنيف يتطلب فيديو في كل الحالات)




ما ناتج التجزئة الدلالية عادة؟ (فئة لكل بكسل في الصورة) (!هوية شخصية مؤكدة لكل وجه) (!صوت يصف الصورة فقط) (!قيمة واحدة لسطوع الصورة)




ماذا يقيس تقاطع على اتحاد في كشف الأجسام؟ (درجة التداخل المكاني بين منطقة متوقعة ومنطقة مرجعية) (!عدد طبقات الشبكة العصبية) (!حجم ملف الصورة على القرص) (!سرعة اتصال الشبكة بالإنترنت)




متى قد تكون الدقة وحدها مقياسا مضللا؟ (عندما تكون الفئة المهمة نادرة وتكاليف الأخطاء غير متساوية) (!عندما تكون الصورة مربعة) (!عندما يكون اسم الملف قصيرا) (!عندما تستخدم شاشة عالية الدقة)




ما الفائدة الشائعة للتعلم بالنقل؟ (الاستفادة من تمثيلات تعلمها نموذج سابق ثم ضبطه لمهمة جديدة) (!منع الحاجة إلى أي بيانات جديدة دائما) (!ضمان انعدام التحيز في كل التطبيقات) (!تحويل نموذج رؤية إلى قاعدة بيانات تلقائيا)




ما الممارسة الأنسب لاكتشاف فجوات الإنصاف في الأداء؟ (تحليل المقاييس مفككة حسب المجموعات والظروف ذات الصلة مع عينات كافية) (!الاكتفاء بمتوسط الأداء على كل الصور) (!حذف جميع حالات الفشل من مجموعة الاختبار) (!زيادة درجة الثقة المعروضة للمستخدم)




أي ممارسة تتفق أكثر مع حماية الخصوصية في مشروع بصري؟ (جمع الحد الأدنى من الصور اللازمة لغرض محدد مع ضبط الوصول والاحتفاظ) (!الاحتفاظ بكل الصور إلى أجل غير محدد) (!إعادة استخدام صور الأشخاص لأي غرض جديد دون مراجعة) (!نشر مجموعة التدريب الشخصية للعامة تلقائيا)





لعبة الذاكرة

البكسل أصغر عنصر رقمي يمثل قيمة موضعية في الصورة
النواة الالتفافية مرشح صغير يتنقل عبر الصورة لاستخراج نمط محلي
صندوق الإحاطة مستطيل يصف الموضع التقريبي لجسم مكتشف
التجزئة الدلالية إسناد فئة إلى كل بكسل من دون فصل المثيلات المتشابهة
الاستدعاء نسبة الحالات الإيجابية الحقيقية التي نجح النظام في اكتشافها
التعلم بالنقل إعادة استخدام نموذج مدرب مسبقا كأساس لمهمة جديدة
التحيز نمط منهجي في البيانات أو النظام قد يؤدي إلى فروق غير مرغوبة في الأداء
المعايرة مدى توافق درجات الثقة مع احتمالات النجاح الفعلية





السحب والإفلات

صل المصطلح بالوصف الصحيح المهمة أو المفهوم
التصنيف إسناد فئة أساسية إلى صورة أو رقعة
الكشف تحديد فئة الجسم وموقعه داخل المشهد
تجزئة المثيلات إنشاء قناع منفصل لكل جسم حتى عند تشارك الأجسام الفئة نفسها
الترشيح الغاوسي تقليل بعض المكونات عالية التردد والضجيج عبر تنعيم محلي
تقاطع على اتحاد قياس نسبة مساحة التقاطع إلى مساحة الاتحاد بين منطقتين
درجة F1 مقياس يوازن بين الإحكام والاستدعاء بمتوسط توافقي





كلمات متقاطعة

بكسل ما أصغر عنصر رقمي في الصورة النقطية؟
التفاف ما العملية المحلية الأساسية التي تمنح الشبكة الالتفافية اسمها؟
تجزئة ما المهمة التي تسند فئة أو هوية مثيل على مستوى البكسل؟
استدعاء ما المقياس الذي يركز على نسبة الإيجابيات الحقيقية التي تم اكتشافها؟
معايرة ما اسم فحص توافق ثقة النموذج مع معدل النجاح الفعلي؟
خصوصية ما المبدأ الذي يحمي بيانات الأشخاص وصورهم من الاستخدام غير المبرر؟





مهام مفتوحة


سهل

  1. تحليل صورة رقمية: اختر صورة غير شخصية، واعرض أبعادها وقنواتها ومدى قيم البكسلات، ثم اكتب فقرة تشرح كيف يمكن أن تؤثر هذه الخصائص في نموذج رؤية حاسوبية.
  2. تجربة مرشح بصري: طبق مرشح تنعيم وكاشف حواف على الصورة نفسها باستخدام أداة مجانية أو بايثون، ثم أنشئ لوحة من ثلاث صور تقارن الأصل والنتيجتين مع تعليق علمي قصير.
  3. بطاقة مجموعة بيانات: اختر MNIST أو CIFAR-10 أو COCO، وأنشئ بطاقة مختصرة بالعربية تصف المهمة والبيانات والتقسيمات والمزايا والقيود ومخاطر التعميم.
  4. فيديو تفسير قصير: سجل فيديو لا يتجاوز ثلاث دقائق يشرح بالعربية الفرق بين التصنيف والكشف والتجزئة مستخدما رسما من صنعك أو صورا غير شخصية.


متوسط

  1. تدريب شبكة صغيرة: ابن نموذجا التفافيا بسيطا على مجموعة تعليمية عامة، وارسم منحنيات خسارة التدريب والتحقق، ثم حدد مؤشرا واحدا على فرط التكيف أو غيابه.
  2. تحليل مصفوفة الالتباس: درب أو استخدم مصنفا جاهزا، وأنشئ مصفوفة التباس، ثم اختر أكثر زوج فئات اختلاطا واقترح سببا تجريبيا واختبارا للتحقق منه.
  3. مقابلة مع ممارس: أجر مقابلة قصيرة مع باحث أو مهندس أو طالب دراسات عليا يعمل في الصور، واسأله عن أصعب مشكلة بيانات واجهها وكيف يقيس نجاح النموذج، ثم لخص النتائج دون نشر بيانات شخصية.
  4. لوحة تقييم نموذج: أنشئ تقريرا يجمع الدقة والإحكام والاستدعاء ودرجة F1 وزمن الاستدلال، واشرح لماذا قد يغير سياق الاستخدام ترتيب النماذج المفضلة.


متقدم

  1. تدقيق إنصاف بصري: صمم تدقيقا لنموذج تصنيف أو كشف باستخدام مجموعة بيانات مناسبة، وقارن الأداء عبر ظروف تصوير أو مجموعات ذات صلة عندما يكون ذلك مشروعا، ثم ناقش حدود العينة والسبب المحتمل لكل فجوة.
  2. مشروع تجزئة: نفذ تجربة تجزئة دلالية أو تجزئة مثيلات على بيانات عامة، وقارن بين تقاطع على اتحاد ومعامل دايس، ثم حلل ثلاث حالات فشل على مستوى الحدود أو الأجسام الصغيرة.
  3. مقارنة كاشفين: قارن نموذجين لكشف الأجسام من حيث متوسط الدقة وزمن الاستدلال والذاكرة على الجهاز نفسه، وأنشئ عرضا يبرر اختيارك لنموذج نشر محدد.
  4. تقييم أثر الخصوصية: اكتب بروتوكولا لمشروع جامعي يستخدم صورا قد تحتوي أشخاصا، وحدد الغرض والحد الأدنى للبيانات والوصول والاحتفاظ والحذف والمخاطر وبدائل أقل تدخلا، ثم راجعه مع زميل وفق قائمة فحص أخلاقية.




مجالات تعلم مرتبطة

تتقاطع الرؤية الحاسوبية مع الجبر الخطي والاحتمالات والتحسين ومعالجة الإشارات وهندسة البرمجيات. في المستوى المتقدم ترتبط أيضا بالروبوتات، والتعلم متعدد الوسائط، والاستشعار عن بعد، والتصوير الطبي، والأنظمة المدمجة. من المفيد أن تتعلم كيف تتحول المتطلبات التطبيقية إلى قرار حول البيانات والبنية والمقياس وقيود النشر.


مسرد

البكسل
عنصر موضعي في الصورة الرقمية يحمل قيمة شدة أو عدة قيم لونية.
القناة اللونية
مصفوفة تمثل مكونا من مكونات اللون مثل الأحمر أو الأخضر أو الأزرق.
الالتفاف
عملية تطبق نواة محلية مشتركة الأوزان عبر الصورة لاستخراج خريطة سمات.
خريطة السمات
تمثيل وسيط يبين استجابة مرشح أو مجموعة مرشحات لأنماط معينة.
صندوق الإحاطة
مستطيل يستخدم لتمثيل موضع جسم في مهمة الكشف.
التجزئة الدلالية
إسناد فئة إلى كل بكسل مع جمع مثيلات الفئة الواحدة تحت التسمية نفسها.
تجزئة المثيلات
إسناد قناع مستقل لكل جسم مكتشف حتى لو كانت عدة أجسام من الفئة نفسها.
التعلم بالنقل
تكييف نموذج مدرب سابقا لمهمة أو مجال جديدين.
تقاطع على اتحاد
نسبة مساحة تقاطع منطقتين إلى مساحة اتحادهما، وتستخدم في الكشف والتجزئة.
الإحكام
نسبة التنبؤات الإيجابية الصحيحة من جميع التنبؤات الإيجابية.
الاستدعاء
نسبة الإيجابيات الحقيقية التي تم اكتشافها من جميع الإيجابيات الحقيقية.
المعايرة
مدى تطابق درجات الثقة مع احتمال صحة التنبؤ في البيانات المماثلة.
تغير المجال
اختلاف توزيع البيانات بين بيئة التدريب وبيئة الاستخدام أو الاختبار الجديدة.
التحيز
نمط منهجي في البيانات أو التصميم أو الاستخدام قد ينتج أداء غير متوازن أو قرارات غير مرغوبة.
تقليل البيانات
مبدأ جمع ومعالجة أقل قدر من البيانات اللازمة لتحقيق غرض محدد ومشروع.


مشروعات aiMOOC