Zum Inhalt springen

Arabic:علم البيانات

Aus MOOCsWiki Staging
Die Druckversion wird nicht mehr unterstützt und kann Darstellungsfehler aufweisen. Bitte aktualisiere deine Browser-Lesezeichen und verwende stattdessen die Standard-Druckfunktion des Browsers.
aiMOOC-Siegel

علم البيانات



مقدمة

علم البيانات مجال متعدد التخصصات يربط بين الإحصاء والبرمجة والمعرفة بالمجال التطبيقي من أجل تحويل البيانات إلى أدلة قابلة للفحص تدعم الفهم والقرار. لا يقتصر عمل عالم البيانات على تدريب نموذج تنبؤي؛ بل يبدأ بصياغة سؤال يمكن الإجابة عنه، ثم جمع بيانات ملائمة، وفحص جودتها، وتنظيفها، واستكشافها، وبناء النماذج عند الحاجة، وتقييمها، وتفسير النتائج، وتوثيق كل خطوة بحيث يستطيع شخص آخر إعادة التحليل.

مخطط يوضح تداخل مجالات المعرفة والبرمجة والتحليل في علم البيانات
تصور عام لتداخل الخبرة بالمجال والأساليب التحليلية والبرمجة في علم البيانات.

هذا المقرر موجّه إلى طلاب الجامعات والمتعلمين في التعليم العالي. يفترض قدرة أساسية على التعامل مع الجداول والعمليات الحسابية ومفاهيم أولية في الاحتمالات، ولا يشترط خبرة متقدمة في البرمجة. ستستخدم أمثلة بلغة Python ومكتبات pandas وMatplotlib وscikit-learn، مع التركيز على منطق العمل العلمي لا على حفظ أوامر برمجية منفردة.

ستعمل في الأمثلة على بيانات حقيقية أو على مصادر رسمية مفتوحة. من المصادر المناسبة للتدريب مجموعة Iris في مستودع UCI، وبيانات Palmer Penguins البيئية، وواجهة مؤشرات البنك الدولي، وبيانات السكان من Our World in Data. عند استخدام أي مجموعة بيانات، اقرأ وصفها وبياناتها الوصفية وترخيصها قبل التحليل؛ فمعنى المتغيرات ومصدرها وطريقة جمعها جزء من الدليل نفسه.


أهداف التعلم

بعد إكمال المقرر، يُتوقع أن تتمكن من:

  1. صياغة سؤال علم بيانات يربط بين متغيرات قابلة للقياس وقرار أو استنتاج واضح.
  2. تقييم مصدر البيانات وطريقة أخذ العينة والانحيازات المحتملة قبل إجراء التحليل.
  3. جمع بيانات من ملف أو واجهة برمجة تطبيقات وتوثيق مصدرها وتاريخ الحصول عليها.
  4. تنظيف البيانات عبر اكتشاف القيم المفقودة والتكرارات والأنواع غير الصحيحة والقيم غير المعقولة.
  5. إجراء تحليل استكشافي يجمع الإحصاءات الوصفية والرسوم البيانية والأسئلة التشخيصية.
  6. اختيار نموذج أساسي مناسب والتمييز بين مسائل التصنيف والانحدار والتجميع.
  7. تقييم النماذج على بيانات لم تُستخدم في التدريب وتجنب تسرب المعلومات.
  8. تفسير النتائج مع مراعاة عدم اليقين والتمييز بين الارتباط والسببية.
  9. إنتاج تحليل قابل لإعادة التنفيذ بملفات واضحة وبيئة موثقة وبذور عشوائية عند الحاجة.
  10. تحويل النتائج إلى توصية قائمة على الأدلة توضح الفوائد والمخاطر والحدود.


من السؤال إلى البيانات


صياغة السؤال والقرار

قبل فتح ملف بيانات، حدّد ما الذي تريد معرفته ولماذا. السؤال الجيد يحدد وحدة التحليل، والمتغيرات المهمة، والفترة الزمنية، والسكان أو النظام الذي تريد التعميم عليه، وما القرار الذي قد يتغير بسبب النتيجة. مثلًا، بدلاً من سؤال فضفاض مثل «هل انخفض الاستهلاك؟» يمكن أن تسأل: «كيف تغير متوسط استهلاك الطاقة الأسبوعي في مباني الجامعة بعد تطبيق سياسة ترشيد محددة، مقارنة بفترة أساس مناسبة؟».

تميّز صياغة السؤال بين أهداف مختلفة. في الوصف تريد تلخيص ما حدث، وفي التفسير تبحث عن علاقات محتملة، وفي التنبؤ تتوقع قيمة مستقبلية أو فئة، وفي الاستدلال السببي تريد تقدير أثر تدخل. لا تستطيع خوارزمية تنبؤ ممتازة أن تحول تلقائيًا بيانات رصدية إلى دليل سببي؛ فالسببية تحتاج تصميمًا أو افتراضات إضافية مثل التجارب العشوائية أو طرق سببية مناسبة.

من المهم أيضًا تحديد معيار القرار قبل النظر إلى النتائج. فالدلالة الإحصائية لا تعني دائمًا أهمية عملية. قد يكون الفرق صغيرًا جدًا بحيث لا يبرر تكلفة التدخل، وقد تكون فائدة متوسطة ذات قيمة كبيرة إذا كان القرار منخفض التكلفة وعالي الأثر. القرار المبني على الأدلة يجمع حجم الأثر وعدم اليقين والتكلفة والمخاطر والعدالة، ولا يعتمد على رقم واحد معزول.


مصادر البيانات والعينات والأخلاقيات

يمكن أن تأتي البيانات من استبيانات وتجارب وأجهزة استشعار وسجلات إدارية وقواعد بيانات وواجهات برمجة تطبيقات ومصادر مفتوحة. اسأل دائمًا: من جُمعت منه البيانات؟ من استُبعد؟ كيف عُرّفت المتغيرات؟ هل تغيرت طريقة القياس عبر الزمن؟ وهل توجد دوافع قد تؤثر في التسجيل؟ هذه الأسئلة تكشف انحياز الاختيار وانحياز القياس ومشكلات التمثيل.

العينة جزء من مجتمع أكبر. إذا كانت العينة غير ممثلة، فلن يعالج حجمها الكبير الانحياز تلقائيًا. كذلك لا ينبغي جمع بيانات شخصية أكثر مما يحتاجه السؤال. طبّق مبدأ تقليل البيانات، واحترم الموافقات والخصوصية وسياسات المؤسسة، ولا تنشر سجلات فردية يمكن إعادة التعرف على أصحابها. في المشروعات التعليمية، فضّل البيانات المفتوحة المجهولة أو البيانات التركيبية عندما يكون الموضوع حساسًا.


جمع بيانات حقيقية وتوثيق الأصل

توفر واجهة مؤشرات البنك الدولي بيانات تنموية زمنية يمكن استدعاؤها برمجيًا. المثال الآتي يجلب مؤشر إجمالي السكان لثلاث دول خلال فترة محددة، ثم يحوله إلى إطار بيانات. لاحظ أن الكود لا يفترض أن القيم كاملة؛ فهو يحتفظ بإمكانية وجود قيم مفقودة كي تُفحص لاحقًا.

import requests
import pandas as pd

# مصدر رسمي: واجهة مؤشرات البنك الدولي
url = (
    "https://api.worldbank.org/v2/country/EGY;JOR;MAR/"
    "indicator/SP.POP.TOTL?format=json&date=2015:2024&per_page=1000"
)
response = requests.get(url, timeout=30)
response.raise_for_status()
payload = response.json()

records = [
    {
        "الدولة": row["country"]["value"],
        "السنة": int(row["date"]),
        "السكان": row["value"]
    }
    for row in payload[1]
]

df = pd.DataFrame(records)
print(df.head())
print(df.dtypes)

عند حفظ البيانات، سجّل رابط المصدر، ورمز المؤشر، والفترة، وتاريخ الاسترجاع، وأي مرشحات استخدمتها. إذا كانت واجهة المصدر توفر بيانات وصفية، فاحفظها إلى جانب البيانات. هذا يمنع فقدان المعنى عندما تتغير مصادر البيانات أو تعاريفها لاحقًا.

شعار لغة Python
تُستخدم Python على نطاق واسع لبناء سير عمل قابل للأتمتة في علم البيانات.


تنظيف البيانات وجودتها


لماذا لا يبدأ التحليل بالنموذج؟

البيانات الخام قد تحتوي على صفوف مكررة، وقيم مفقودة، ووحدات مختلفة، وأخطاء إدخال، وترميزات غير متسقة، وتواريخ مخزنة كنصوص. إذا تجاهلت هذه المشكلات، فقد ينتج نموذج دقيق ظاهريًا لكنه يتعلم من خطأ في البيانات. لذلك يكون تنظيف البيانات عملية استدلال: كل تعديل يجب أن يستند إلى قاعدة مفهومة، لا إلى رغبة في جعل الجدول «أجمل».

ابدأ بفحص البنية: عدد الصفوف والأعمدة، أنواع المتغيرات، مدى القيم، نسب الفقد، التكرار، وفئات المتغيرات الاسمية. بعد ذلك افحص القيم غير المعقولة وفق معرفة المجال. العمر السالب أو تاريخ النهاية السابق لتاريخ البداية مثالان على أخطاء واضحة، بينما القيمة المتطرفة جدًا قد تكون خطأ أو ملاحظة صحيحة مهمة؛ لا تحذفها دون دليل.

شعار مكتبة pandas
تساعد مكتبة pandas في تمثيل البيانات الجدولية وتنظيفها وتحويلها.


القيم المفقودة والتكرارات والأنواع

تعامل مع الفقد وفق آلية معقولة. حذف الصفوف قد يكون مقبولًا إذا كان الفقد قليلًا وغير منهجي، لكنه قد يسبب انحيازًا إذا كان الفقد مرتبطًا بمتغير مهم. التعويض بالوسيط أو بنموذج قد يكون مناسبًا في بعض السياقات، لكن يجب أن يتم داخل سير التحقق كي لا تتسرب معلومات من مجموعة الاختبار إلى التدريب.

# تقرير أولي عن الجودة
print(df.isna().mean().sort_values(ascending=False))
print("عدد الصفوف المكررة:", df.duplicated().sum())

# تنظيف مدروس
clean = df.drop_duplicates().copy()
clean["السنة"] = pd.to_numeric(clean["السنة"], errors="coerce")
clean["السكان"] = pd.to_numeric(clean["السكان"], errors="coerce")

# لا نحذف القيم المفقودة إلا للمتغير المطلوب في هذا التحليل
clean = clean.dropna(subset=["السكان"])

# تحقق من النطاق قبل الاستمرار
assert clean["السنة"].between(2015, 2024).all()
assert (clean["السكان"] > 0).all()

التحقق الآلي باستخدام الشروط مفيد لأنه يحول توقعات الجودة إلى اختبارات قابلة لإعادة التنفيذ. وفي المشروعات الأكبر يمكن توسيع ذلك إلى اختبارات مخطط البيانات، وفحص المفاتيح الفريدة، ومراقبة تغير التوزيعات بين إصدارات البيانات.


سجل التحويلات

لا تُجرِ تعديلات يدوية غير موثقة داخل جدول ثم تنسَها. الأفضل أن تُكتب التحويلات في كود أو خطوات يمكن تكرارها من المصدر الخام إلى النسخة النظيفة. احتفظ بنسخة خام غير معدلة، واجعل المخرجات النظيفة مشتقة منها. إذا غيّرت تعريف متغير، فسجّل السبب والقاعدة، لأن إعادة الإنتاج تعني إعادة بناء النتيجة لا مجرد الاحتفاظ بصورة نهائية من الملف.


الاستكشاف والتصور


الإحصاء الوصفي أولًا

التحليل الاستكشافي للبيانات يساعدك على فهم الشكل العام قبل بناء النماذج. استخدم المتوسط والوسيط والانحراف المعياري والمدى الربيعي للمتغيرات العددية، والتكرارات والنسب للمتغيرات الفئوية. لا تختصر كل شيء في المتوسط؛ فتوزيع ملتوي قد يجعل الوسيط أكثر تمثيلًا، ومجموعتان لهما المتوسط نفسه قد تختلفان جذريًا في التشتت.

منحنى توزيع طبيعي معياري
التوزيع الطبيعي نموذج احتمالي مهم، لكنه ليس افتراضًا افتراضيًا لكل بيانات حقيقية.
مثال على مخطط صندوقي يوضح المركز والتشتت
المخطط الصندوقي يلخص الوسيط والربيعات ويساعد في رؤية القيم البعيدة، لكنه لا يقرر وحده أن القيمة خطأ.


رسوم تكشف الأسئلة قبل الإجابات

اختر الرسم وفق نوع السؤال. المدرج التكراري مناسب لتوزيع متغير عددي، والمخطط الصندوقي للمقارنة بين مجموعات، والمخطط المبعثر للعلاقة بين متغيرين عدديين، والخط الزمني للتغير عبر الزمن. يجب أن يحمل الرسم عنوانًا واضحًا ومحاور ووحدات، وأن يتجنب اقتطاع المحور أو استخدام ألوان توحي بفروق لا تدعمها البيانات.

يمكنك استخدام بيانات Palmer Penguins، وهي بيانات بيئية حقيقية جُمعت في سياق بحثي في أنتاركتيكا، للتدرب على التنظيف والتصور. المثال التالي يقرأ ملف CSV من مستودع المشروع ويعرض الفقد ثم ينشئ مخططًا مبعثرًا ومخططًا صندوقيًا.

import pandas as pd
import seaborn as sns
import matplotlib.pyplot as plt

url = "https://raw.githubusercontent.com/allisonhorst/palmerpenguins/main/inst/extdata/penguins.csv"
penguins = pd.read_csv(url)

print(penguins.isna().sum())

sns.scatterplot(
    data=penguins,
    x="bill_length_mm",
    y="bill_depth_mm",
    hue="species"
)
plt.title("العلاقة بين طول المنقار وعمقه حسب النوع")
plt.xlabel("طول المنقار بالملليمتر")
plt.ylabel("عمق المنقار بالملليمتر")
plt.show()

sns.boxplot(data=penguins, x="species", y="body_mass_g")
plt.title("توزيع كتلة الجسم حسب النوع")
plt.xlabel("النوع")
plt.ylabel("كتلة الجسم بالغرام")
plt.show()


الارتباط لا يساوي السببية

يقيس معامل الارتباط الخطي قوة العلاقة الخطية واتجاهها بين متغيرين، لكنه لا يثبت أن أحدهما يسبب الآخر. قد تنشأ العلاقة بسبب متغير ثالث، أو اتجاه زمني مشترك، أو انحياز في العينة، أو صدفة. كما أن معامل ارتباط قريبًا من الصفر لا يعني بالضرورة غياب علاقة؛ فقد تكون العلاقة غير خطية.

مجموعة مخططات مبعثرة توضح معاملات ارتباط خطية مختلفة
أمثلة بصرية لعلاقات خطية مختلفة. يجب تفسير معامل الارتباط مع شكل البيانات لا بمعزل عنه.

عند عرض علاقة، اذكر بدائل التفسير وحدود التصميم. إذا كان الهدف سببيًا، فاسأل عن آلية التخصيص ومجموعة المقارنة والعوامل المربكة، ولا تستخدم اللغة السببية لمجرد أن نموذجًا تنبؤيًا وجد نمطًا.


النمذجة والتقييم


من خط أساس إلى نموذج

النموذج أداة تبسيط. في الانحدار تتنبأ بقيمة عددية، وفي التصنيف تتنبأ بفئة، وفي التجميع تبحث عن بنية غير خاضعة للإشراف. ابدأ دائمًا بخط أساس بسيط: متوسط في الانحدار، أو الفئة الأكثر شيوعًا في التصنيف، أو قاعدة عملية معروفة. إذا لم يتفوق النموذج المعقد على الخط الأساس بصورة مستقرة، فقد لا يضيف قيمة.

قسّم البيانات إلى تدريب واختبار قبل الضبط. تُستخدم بيانات التدريب لاختيار المعلمات والتعلم، وتُحجز بيانات الاختبار للتقييم النهائي. عند إجراء معالجة مسبقة مثل التعويض أو القياس، ضعها داخل Pipeline كي تُلائم على التدريب فقط. هذا يمنع تسرب البيانات، وهو وصول معلومات من التقييم إلى عملية التدريب.


مثال تصنيف حقيقي باستخدام Iris

تتكون مجموعة Iris الكلاسيكية في مستودع UCI من 150 ملاحظة لأزهار السوسن، وأربع سمات عددية، وثلاث فئات. المثال التالي يجلبها من المستودع، ثم يبني نموذج انحدار لوجستي داخل سير معالجة قابل لإعادة التنفيذ.

from ucimlrepo import fetch_ucirepo
from sklearn.model_selection import train_test_split
from sklearn.pipeline import make_pipeline
from sklearn.impute import SimpleImputer
from sklearn.preprocessing import StandardScaler
from sklearn.linear_model import LogisticRegression
from sklearn.metrics import accuracy_score, classification_report

iris = fetch_ucirepo(id=53)
X = iris.data.features
y = iris.data.targets.squeeze()

X_train, X_test, y_train, y_test = train_test_split(
    X,
    y,
    test_size=0.25,
    random_state=42,
    stratify=y
)

model = make_pipeline(
    SimpleImputer(strategy="median"),
    StandardScaler(),
    LogisticRegression(max_iter=1000)
)

model.fit(X_train, y_train)
pred = model.predict(X_test)

print("الدقة:", accuracy_score(y_test, pred))
print(classification_report(y_test, pred))

لا تتعامل مع الدقة الناتجة عن تشغيل واحد بوصفها حقيقة مطلقة. مع عينات صغيرة يمكن أن تتغير النتيجة بتغير التقسيم. استخدم التحقق المتقاطع عند المقارنة بين النماذج، واحتفظ بمجموعة اختبار مستقلة للقرار النهائي كلما سمح حجم البيانات.


المقاييس وعدم توازن الفئات

الدقة مناسبة عندما تكون الأخطاء متقاربة في التكلفة والفئات متوازنة نسبيًا، لكنها قد تخدع في البيانات غير المتوازنة. إذا كانت الفئة الإيجابية نادرة، افحص الاستدعاء والدقة الإيجابية ومصفوفة الالتباس، واختر العتبة حسب تكلفة الأخطاء. في الانحدار استخدم مقاييس مثل متوسط الخطأ المطلق والجذر التربيعي لمتوسط مربع الخطأ، مع فهم وحداتها وحساسيتها للقيم المتطرفة.

لا تختَر المقياس بعد رؤية النموذج الأفضل فقط؛ حدد المقياس وفق قرار العمل أو السؤال العلمي. فإذا كان فقدان حالة نادرة خطيرًا، قد تفضّل استدعاء أعلى حتى لو زادت الإنذارات الكاذبة. هذا اختيار قيمي وعملي يجب توثيقه، وليس قرارًا خوارزميًا محضًا.


التفسير وإعادة الإنتاج


تفسير النموذج دون المبالغة

التفسير يربط مخرجات النموذج بالسؤال الأصلي. في نموذج خطي، قد تساعد المعاملات في فهم اتجاه العلاقة ضمن شروط النموذج. في النماذج الأكثر تعقيدًا يمكن استخدام أهمية السمات أو تحليلات محلية، لكن هذه الأدوات تصف سلوك النموذج ولا تثبت بالضرورة آلية سببية في العالم. تحقق من الاستقرار: هل تتغير الاستنتاجات بشدة إذا تغيرت العينة أو طريقة المعالجة؟

فرّق بين عدم اليقين الإحصائي وعدم اليقين الناتج عن التصميم. ففاصل الثقة لا يعالج تلقائيًا انحياز العينة أو القياس الخاطئ. كما أن نموذجًا عالي الأداء في بيانات تاريخية قد يفشل بعد تغير السكان أو العملية التي تولد البيانات، لذلك يلزم مراقبة الانجراف وتحديث التحقق بمرور الوقت.


مبدأ إعادة الإنتاج

التحليل القابل لإعادة الإنتاج يسمح لشخص آخر بإعادة الخطوات من المصدر إلى النتيجة في بيئة موثقة. احفظ الكود والبيانات أو طريقة جلبها، وملف المتطلبات، وتعريف المتغيرات، والبذور العشوائية، وإصدار المكتبات، ووصفًا واضحًا للخطوات. استخدم التحكم في الإصدارات عند العمل الجماعي، وافصل البيانات الخام عن المشتقات.

شعار مشروع Jupyter
دفاتر Jupyter مفيدة للشرح والاستكشاف، لكن إعادة الإنتاج تتطلب أيضًا ضبط البيئة ومصادر البيانات والخطوات.

يمكن أن تكون الدفاتر التفاعلية مفيدة لأنها تجمع النص والكود والنتائج، لكنها قد تخفي اعتمادًا على ترتيب تشغيل الخلايا. قبل تسليم التحليل، أعد تشغيله من البداية في بيئة نظيفة. لا يكفي أن «يعمل على جهازك»؛ يجب أن يكون المسار إلى النتيجة واضحًا وقابلًا للتدقيق.


قائمة فحص لإعادة التنفيذ

  1. احفظ نسخة خام أو رابطًا ثابتًا لمصدر البيانات مع تاريخ الاسترجاع.
  2. اجعل التنظيف والتحويل في كود قابل للتنفيذ بدل التعديلات اليدوية غير المسجلة.
  3. ثبّت الإصدارات المهمة في ملف بيئة أو متطلبات.
  4. استخدم بذرة عشوائية عند وجود خطوة عشوائية، مع فهم أن ذلك لا يعالج كل مصادر عدم الحتمية.
  5. أنشئ ملفًا وصفيًا يشرح السؤال، والبيانات، وطريقة التشغيل، والمخرجات المتوقعة.
  6. أعد تشغيل المشروع من البداية قبل النشر أو التسليم.


من النتائج إلى قرار قائم على الأدلة

المنتج النهائي لعلم البيانات ليس الرسم أو النموذج وحده، بل حجة قابلة للفحص تربط البيانات بالقرار. ابدأ بتذكير القارئ بالسؤال، ثم قدم النتيجة الأساسية وحجم الأثر وعدم اليقين، ثم ناقش القيود والبدائل، وأخيرًا حدد ما الذي يمكن فعله وما الذي لا يمكن استنتاجه.

في قرار واقعي، اسأل عن تكاليف الخطأ من النوعين، وعن الفئات التي قد تتحمل الضرر، وعن إمكانية الاستئناف البشري إذا استُخدم النموذج في عملية مؤثرة. لا ينبغي استخدام نموذج تنبؤي وحده لاتخاذ قرارات عالية المخاطر بشأن أفراد دون حوكمة ومراجعة مناسبة. كما يجب مراقبة نتائج القرار بعد التطبيق: هل تحققت الفائدة؟ هل ظهر أثر غير متوقع؟ وهل تغيرت البيانات؟

يمكنك تمثيل القرار في جدول بسيط يربط الأدلة بالخيارات:

السؤال ما الذي يجب توثيقه؟
ما قوة الدليل؟ مصدر البيانات، التصميم، حجم العينة، نتائج التحقق، وعدم اليقين.
ما قيمة الأثر؟ حجم الفرق أو التحسن بوحدات مفهومة، لا مجرد قيمة إحصائية.
ما المخاطر؟ أخطاء النموذج، الانحيازات، تغير البيانات، وتبعات الاستخدام.
ما البدائل؟ خط أساس، إجراء أقل تكلفة، جمع بيانات إضافية، أو تجربة قبل التوسع.
كيف نتابع؟ مؤشرات مراقبة، موعد مراجعة، ومعيار واضح لإيقاف النظام أو تعديله.

قاعدة عملية: إذا لم تستطع شرح مصدر البيانات، ومسار المعالجة، وطريقة التقييم، وحدود الاستنتاج لشخص متخصص آخر، فالمشروع لم يصل بعد إلى مستوى دليل قابل للاعتماد.


مهام تفاعلية


اختبار: اختبر معرفتك

ما الخطوة الأنسب قبل اختيار خوارزمية تعلم آلي؟ (صياغة سؤال واضح وتحديد القرار المطلوب) (!اختيار النموذج الأكثر تعقيدًا مباشرة) (!حذف جميع القيم المتطرفة فورًا) (!استخدام مجموعة الاختبار لضبط المعلمات)




ما الغرض الأساسي من الاحتفاظ ببيانات اختبار لم تُستخدم في التدريب؟ (تقدير أداء النموذج على بيانات غير مرئية أثناء التعلم) (!زيادة عدد سمات التدريب) (!تعويض القيم المفقودة في البيانات الخام) (!إثبات أن العلاقة سببية)




أي عبارة تصف تسرب البيانات؟ (وصول معلومات من بيانات التقييم إلى عملية التدريب) (!انخفاض عدد الصفوف بعد إزالة التكرار) (!تغيير اسم عمود لتوضيح معناه) (!استخدام رسم مبعثر قبل التدريب)




ما التفسير الصحيح لارتباط مرتفع بين متغيرين؟ (توجد علاقة قوية وفق مقياس الارتباط ولا تثبت السببية وحدها) (!أحد المتغيرين يسبب الآخر حتمًا) (!النموذج سيعمل على أي مجتمع جديد) (!لا توجد عوامل مربكة محتملة)




لماذا نبدأ بخط أساس بسيط عند النمذجة؟ (لمعرفة ما إذا كان النموذج المعقد يضيف قيمة فعلية) (!لإلغاء الحاجة إلى بيانات اختبار) (!لضمان العدالة بين جميع الفئات) (!لتحويل أي مسألة إلى تصنيف)




متى قد تكون الدقة مقياسًا مضللًا في التصنيف؟ (عندما تكون الفئات غير متوازنة وتختلف تكلفة الأخطاء) (!عندما تكون جميع الفئات متساوية تقريبًا) (!عندما تكون البيانات محفوظة بصيغة جدول) (!عندما نستخدم مخططًا صندوقيًا)




ما الممارسة الأفضل عند تنظيف البيانات؟ (توثيق قواعد التحويل وجعلها قابلة لإعادة التنفيذ) (!تعديل القيم يدويًا دون سجل) (!حذف كل صف يحتوي قيمة كبيرة) (!استبدال جميع القيم المفقودة بالصفر دائمًا)




ما الذي يجعل الرسم البياني أداة استكشاف جيدة؟ (اختياره بما يناسب نوع المتغير والسؤال مع توضيح المحاور والوحدات) (!استخدام أكبر عدد ممكن من الألوان) (!إخفاء القيم التي لا توافق التوقع) (!اقتطاع المحور دائمًا لتكبير الفروق)




ما المقصود بإعادة إنتاج التحليل؟ (إمكانية إعادة الخطوات من البيانات والمصادر الموثقة إلى النتائج) (!الحصول على النتيجة نفسها دون الاحتفاظ بالكود) (!تكرار الرسم يدويًا من صورة سابقة) (!استخدام حاسوب من النوع نفسه فقط)




أي عنصر يجب أن يدخل في قرار قائم على الأدلة إلى جانب أداء النموذج؟ (عدم اليقين والتكلفة والمخاطر والقيود) (!عدد أسطر الكود فقط) (!شعبية المكتبة البرمجية فقط) (!جمال لوحة الألوان فقط)





لعبة الذاكرة

التنظيف اكتشاف الأخطاء والتكرارات والفقد ومعالجتها وفق قواعد موثقة
الاستكشاف فحص التوزيعات والعلاقات والأنماط قبل تثبيت الفرضيات أو النماذج
خط الأساس حل بسيط يُستخدم مرجعًا لمعرفة القيمة المضافة للنموذج
التسرب انتقال معلومات من التقييم إلى التدريب بما يبالغ في تقدير الأداء
التحقق المتقاطع تكرار التدريب والتقييم عبر تقسيمات متعددة لقياس الاستقرار
إعادة الإنتاج القدرة على إعادة تنفيذ المسار التحليلي من المصدر إلى النتيجة





السحب والإفلات

طابق المصطلح مع الوصف الصحيح. علم البيانات
مخطط مبعثر فحص العلاقة بين متغيرين عدديين
مخطط صندوقي تلخيص المركز والتشتت ورؤية القيم البعيدة
مجموعة التدريب الجزء المستخدم لتقدير معلمات النموذج
مجموعة الاختبار الجزء المحجوز لتقييم الأداء النهائي
الاستدعاء نسبة الحالات الإيجابية الحقيقية التي اكتشفها المصنف
بيانات وصفية معلومات تشرح المصدر والمتغيرات والوحدات وطريقة الجمع





كلمات متقاطعة

تنظيف ما العملية التي تعالج الفقد والتكرار والأخطاء قبل التحليل؟
استكشاف ما المرحلة التي تستخدم الإحصاءات والرسوم لفهم البيانات أوليًا؟
ارتباط ما المصطلح الذي يصف قوة علاقة إحصائية دون إثبات السببية؟
انحدار ما نوع النمذجة المستخدم غالبًا للتنبؤ بقيمة عددية؟
تحيز ما الاسم العام لانحراف منهجي قد يجعل العينة أو القياس غير ممثل؟
تكرارية ما الصفة المقصودة بإمكانية إعادة تنفيذ التحليل بالخطوات الموثقة؟





مهام مفتوحة


سهل

  1. بطاقة مصدر بيانات: اختر مجموعة بيانات مفتوحة من UCI أو البنك الدولي أو Our World in Data، واكتب بطاقة عربية من فقرة واحدة توضح المصدر ووحدة التحليل والمتغيرات والترخيص والقيود.
  2. تقرير جودة صغير: حمّل جدولًا مفتوحًا وافحص عدد الصفوف والأنواع ونسب القيم المفقودة والتكرارات، ثم أنشئ جدولًا يلخص ما يحتاج إلى تنظيف دون تعديل البيانات الأصلية.
  3. رسم يجيب عن سؤال: أنشئ رسمًا واحدًا مناسبًا لسؤال وصفي، وضع عنوانًا ومحاور ووحدات واضحة، ثم اكتب ثلاثة أسطر تفسر ما يظهر وما لا يمكن استنتاجه.
  4. مقارنة المتوسط والوسيط: اختر متغيرًا عدديًا واحسب المتوسط والوسيط والمدى الربيعي، ثم فسّر أي فرق بين مقاييس المركز بالرجوع إلى شكل التوزيع.


متوسط

  1. خط أنابيب تنظيف: اكتب كودًا يعيد تنفيذ تنظيف مجموعة بيانات من النسخة الخام إلى النسخة الجاهزة للتحليل، مع اختبارات تلقائية للأنواع والنطاقات والتكرار.
  2. دراسة استكشافية للبطاريق: استخدم بيانات Palmer Penguins لإنشاء ثلاثة رسوم مختلفة ومصفوفة ملخصات، ثم صغ ثلاث فرضيات تفسيرية مع توضيح أنها ليست استنتاجات سببية.
  3. نموذج تصنيف للسوسن: استخدم مجموعة Iris لبناء خط أساس ونموذج تصنيف، واحتفظ باختبار مستقل، ثم قارن الدقة والاستدعاء ومصفوفة الالتباس في تقرير قصير.
  4. مراجعة رسم منشور: اختر رسمًا من مصدر موثوق، وحلّل اختيار المحاور والألوان والمقاييس والسياق، ثم اقترح نسخة بديلة إذا وجدت عنصرًا يمكن أن يضلل القارئ.


متقدم

  1. مشروع قرار قائم على الأدلة: اختر سؤالًا عامًا غير حساس باستخدام بيانات مفتوحة، وابنِ تحليلًا كاملًا من صياغة السؤال إلى توصية تتضمن حجم الأثر وعدم اليقين والتكاليف والقيود وخطة متابعة.
  2. اختبار قابلية إعادة الإنتاج: تبادل مشروعًا تحليليًا مع زميل، وحاول تشغيله من بيئة جديدة اعتمادًا على التعليمات فقط، ثم سجّل نقاط الفشل وعدّل الملفات حتى يصبح التشغيل من البداية ممكنًا.
  3. تدقيق تسرب البيانات: صمم مثالين صغيرين، أحدهما سليم والآخر يحتوي تسربًا متعمدًا، وقارن نتائج التقييم واشرح لماذا يبدو النموذج المتسرب أفضل بصورة زائفة.
  4. مقابلة مهنية في علم البيانات: أجر مقابلة بإذن واضح مع باحث أو محلل بيانات حول كيفية تحويل نتائج التحليل إلى قرارات، ثم أنشئ ملخصًا مجهول التفاصيل الشخصية يربط الإجابات بمفاهيم الجودة والعدالة وعدم اليقين وإعادة الإنتاج.





مجالات تعلم مرتبطة

يرتبط علم البيانات أيضًا بعلوم الحاسوب والرياضيات والاقتصاد والصحة والهندسة والعلوم الاجتماعية والإدارة. تختلف الأدوات بين هذه المجالات، لكن مبادئ السؤال الجيد وجودة البيانات والتقييم الصادق والتوثيق تبقى أساسية.


مسرد

علم البيانات
ممارسة منهجية لاستخراج معرفة قابلة للفحص من البيانات باستخدام الإحصاء والحوسبة والمعرفة بالمجال.
وحدة التحليل
الكيان الذي يمثل كل صف أو ملاحظة، مثل شخص أو جهاز أو دولة أو تجربة.
البيانات الوصفية
معلومات تشرح مصدر البيانات ومعاني المتغيرات والوحدات وطريقة الجمع والترخيص.
القيمة المفقودة
خانة لا تحتوي ملاحظة صالحة لمتغير معين، وقد يكون غيابها عشوائيًا أو منهجيًا.
التحليل الاستكشافي
فحص أولي للتوزيعات والعلاقات والجودة باستخدام الإحصاءات والرسوم.
خط الأساس
طريقة بسيطة تُستخدم مرجعًا لتقييم ما إذا كان النموذج الأكثر تعقيدًا يضيف فائدة.
تسرب البيانات
انتقال معلومات لا ينبغي أن تكون متاحة أثناء التدريب من بيانات التقييم أو المستقبل إلى النموذج.
التحقق المتقاطع
أسلوب يعيد تقسيم بيانات التدريب عدة مرات لتقدير استقرار الأداء ومقارنة النماذج.
مصفوفة الالتباس
جدول يقارن الفئات الحقيقية بالفئات التي توقعها نموذج التصنيف.
الارتباط
مقياس للعلاقة بين متغيرات لا يكفي وحده لإثبات علاقة سببية.
الانحياز
انحراف منهجي في الجمع أو القياس أو الاختيار أو النمذجة قد يشوه الاستنتاج.
إعادة الإنتاج
إمكانية إعادة تنفيذ التحليل من المصادر والخطوات الموثقة إلى النتائج.
عدم اليقين
مقدار ما لا نعرفه عن تقدير أو تنبؤ بسبب العينة أو الضوضاء أو النموذج أو التصميم.
القرار القائم على الأدلة
اختيار يوازن بين النتائج الكمية وعدم اليقين والتكلفة والمخاطر والقيود والقيم المؤسسية.


مشروعات aiMOOC