Arabic:تحليل البيانات الضخمة

تحليل البيانات الضخمة
مقدمة
أصبحت البيانات الضخمة جزءًا أساسيًا من البنية الرقمية للجامعات والحكومات والشركات والمختبرات العلمية والمدن الذكية. ولا يشير المصطلح إلى حجم الملفات فقط، بل إلى حالات تصبح فيها خصائص مثل الحجم والسرعة والتنوع والتباين تحديًا يتجاوز ما تستطيع المقاربات التقليدية معالجته بكفاءة. لذلك يرتبط تحليل البيانات الضخمة بتصميم أنظمة قابلة للتوسع، وتوزيع التخزين والحوسبة، وبناء خطوط بيانات موثوقة، ثم تطبيق أساليب التحليل الإحصائي والتعلم الآلي مع مراعاة الجودة والحوكمة والأمن والخصوصية.

ستتعلم في هذا المقرر كيف تنتقل البيانات من مصادرها إلى طبقات الاستيعاب والتخزين والمعالجة والتحليل، ولماذا تعتمد المنصات واسعة النطاق على الحوسبة الموزعة والتخزين الموزع، وكيف تختلف معالجة الدفعات عن معالجة التدفقات، وكيف تُختار بنية مناسبة تبعًا لسؤال العمل أو البحث العلمي.
المتطلبات السابقة
يفترض المقرر معرفة أولية بمفاهيم البرمجة، وقواعد البيانات وSQL، والإحصاء الوصفي، ومبادئ أنظمة التشغيل والشبكات. تساعد معرفة Python على تنفيذ الأنشطة، لكنها ليست شرطًا لفهم المفاهيم المعمارية. المهم أن تكون قادرًا على التفكير في البيانات بوصفها سجلات لها مخطط وجودة ومصدر وزمن وصول، لا مجرد أرقام منفصلة.
أهداف التعلم
بعد إتمام المقرر ينبغي أن تكون قادرًا على:
- تفسير خصائص البيانات الضخمة والتمييز بين مشكلة الحجم ومشكلة السرعة ومشكلة التنوع.
- شرح مبادئ التجزئة والتكرار وتحمل الأعطال والمحلية في الأنظمة الموزعة.
- تحليل أدوار HDFS وMapReduce وYARN وApache Spark في المعالجة واسعة النطاق.
- تصميم خط بيانات يضم الاستيعاب والتحقق والتحويل والتخزين والمعالجة والتقديم.
- التمييز بين معالجة الدفعات ومعالجة التدفقات واختيار النمط المناسب لكل حالة.
- استخدام مفاهيم Apache Kafka لفهم تدفق الأحداث والموضوعات والتجزئات والمستهلكين.
- تقييم جودة البيانات وأصلها وخصوصيتها ومخاطرها قبل بناء نموذج تحليلي.
- اقتراح تطبيقات قابلة للتنفيذ في الحكومة والأعمال والعلوم والبنية التحتية الذكية.
من البيانات الكبيرة إلى نظام تحليلي قابل للتوسع
تظهر مشكلة البيانات الضخمة عندما تصبح خصائص البيانات أو متطلبات الخدمة سببًا في عدم كفاية جهاز واحد أو قاعدة بيانات تقليدية أو معالجة متسلسلة. قد تكون لديك مليارات السجلات، أو أحداث تصل كل ثانية، أو ملفات نصوص وصور وسجلات حساسات ومخططات مختلفة، أو حاجة إلى استجابة منخفضة الكمون مع استمرار وصول البيانات.
| الخاصية | السؤال الهندسي | مثال |
|---|---|---|
| الحجم | أين نخزن البيانات وكيف نوزعها؟ | سجلات معاملات أو قياسات تمتد إلى تيرابايتات وبيتابايتات |
| السرعة | هل يجب المعالجة عند وصول الحدث أم لاحقًا؟ | تيار مستمر من حساسات أو نقرات تطبيق |
| التنوع | كيف نوحد صيغًا ومخططات مختلفة؟ | جداول وJSON وصور ونصوص وسجلات أجهزة |
| التباين | كيف نتعامل مع تغير المعدل أو المخطط؟ | مواسم الطلب أو تحديث بنية الحدث |
| القيمة | ما القرار أو المعرفة التي ستنتج؟ | تنبؤ بالطلب أو كشف شذوذ أو تحسين خدمة |
من الأخطاء الشائعة مساواة البيانات الضخمة بمستودع ضخم فقط. إذا كان سؤال التحليل بسيطًا ولا يتطلب توسعًا أفقيًا، فقد يكون نظام تقليدي أصغر أكثر كفاءة وأقل تكلفة. تبدأ الهندسة الجيدة من السؤال والمتطلبات ثم تختار البنية، لا من اختيار أداة شائعة ثم محاولة فرضها على المشكلة.

بنية مرجعية لمنصة بيانات ضخمة
يمكن تصور المنصة على شكل طبقات مترابطة. هذا النموذج ليس منتجًا واحدًا، بل طريقة لتنظيم المسؤوليات:
| الطبقة |
|---|
| مصادر البيانات: تطبيقات ومعاملات وحساسات وملفات وواجهات برمجية |
| ↓ |
| الاستيعاب: دفعات دورية أو أحداث متدفقة أو التقاط تغييرات قواعد البيانات |
| ↓ |
| التخزين: ملفات موزعة أو تخزين كائني أو بحيرة بيانات أو مستودع تحليلي |
| ↓ |
| المعالجة: تنظيف وتحويل وتجميع وربط وحساب موزع |
| ↓ |
| التحليل: SQL وإحصاء وتعلم آلي وكشف شذوذ ومحاكاة |
| ↓ |
| التقديم: لوحات معلومات وتقارير وواجهات برمجية وخدمات قرار |
| الحوكمة والأمن والميتاداتا والمراقبة تمتد عبر جميع الطبقات |
يتوافق هذا التفكير مع الأطر المرجعية التي تفصل بين مزود البيانات ومزود التطبيق ومزود إطار المعالجة والمستهلك، مع وجود وظائف إدارة وأمن وخصوصية عابرة للطبقات. الفائدة التعليمية من النموذج هي أنك تستطيع تتبع أي سجل من لحظة إنشائه إلى القرار الذي استُخدم فيه.
الأنظمة الموزعة والتخزين واسع النطاق
في النظام الموزع تُقسَّم البيانات والعمل بين عقد متعددة تتواصل عبر الشبكة. هذا يوفر التوسع الأفقي بإضافة عقد جديدة، لكنه يضيف تحديات: فشل عقد، تأخر الشبكة، تفاوت الحمل، إعادة المحاولة، اتساق النسخ، وترتيب الأحداث. لذلك يجب تصميم النظام على أساس أن الأعطال ستحدث وأن عملية واحدة بطيئة قد تؤثر في مرحلة كاملة.
من أهم المفاهيم:
- التجزئة: توزيع السجلات أو الملفات على أجزاء تسمح بالعمل المتوازي.
- التكرار: الاحتفاظ بنسخ متعددة لتحسين التوفر وتحمل فقدان عقدة أو قرص.
- محلية البيانات: تقليل نقل البيانات عبر الشبكة عندما يكون نقل الحساب إلى البيانات أكثر كفاءة.
- تحمل الأعطال: اكتشاف الفشل وإعادة تشغيل المهام أو قراءة نسخة بديلة دون فقد النتيجة المطلوبة.
- موازنة الحمل: تجنب أن تصبح عقدة أو تجزئة واحدة عنق زجاجة.

في HDFS يدير NameNode بيانات وصف نظام الملفات، بينما تخزن DataNodes كتل البيانات الفعلية. ويستفيد النظام من تقسيم الملفات وتكرار الكتل عبر العقد. أما YARN فيفصل إدارة موارد العنقود عن منطق التطبيقات: يوزع ResourceManager الموارد، وتدير NodeManagers الموارد المحلية، بينما يتفاوض ApplicationMaster على الموارد اللازمة لتطبيق معين.
MapReduce: تقسيم العمل ثم تجميعه
MapReduce نموذج لمعالجة مجموعات بيانات كبيرة في مرحلتين منطقيتين أساسيتين. في Map تتحول السجلات إلى أزواج مفتاح وقيمة أو نتائج وسيطة، ثم تقوم مرحلة Shuffle and Sort بتجميع القيم وفق المفاتيح ونقلها إلى المهام المناسبة، وبعدها تنتج Reduce التجميعات النهائية.

مثال تعليمي: لحساب عدد الرحلات لكل منطقة في سجل حضري، تنتج مرحلة Map زوجًا من نوع منطقة ثم واحد لكل رحلة، وتجمع مرحلة Shuffle القيم بحسب المنطقة، ثم تجمع Reduce الأعداد. قوة النموذج أنه يوزع العمل ويعيد تشغيل المهام عند الفشل، لكن كثرة مراحل Shuffle قد تصبح مكلفة بسبب القراءة والكتابة والنقل عبر الشبكة.
Apache Spark: خطط تنفيذ موزعة متعددة المراحل
Apache Spark محرك موحد للتحليلات واسعة النطاق يدعم المعالجة الدُفعية والتدفقية وSQL وعلوم البيانات. يبني Spark خطة تنفيذ موزعة ويقسمها إلى مهام تعمل على أجزاء البيانات. وتسمح فكرة التقييم الكسول بتجميع التحويلات قبل التنفيذ، بينما يساعد الاحتفاظ ببيانات وسيطة مناسبة في الذاكرة على تسريع الأعمال التكرارية عندما تكون الموارد كافية.

في تطبيق Spark يوجد عادة برنامج قيادة ينسق العمل، ومدير عنقود يخصص الموارد، ومنفذون ينفذون المهام على العقد. وتوفر DataFrames تمثيلًا جدوليًا يساعد محسن الاستعلام على اختيار خطط تنفيذ أفضل. عند حدوث فشل يمكن إعادة حساب بعض البيانات اعتمادًا على أصل التحويلات بدل الاعتماد على نسخة كاملة من كل نتيجة وسيطة.
خطوط أنابيب البيانات ومعالجة الدفق
خط البيانات سلسلة عمليات تنقل البيانات من المصدر إلى حالة يمكن استخدامها للتحليل أو الخدمة. لا يكفي أن تنجح عملية مرة واحدة؛ يجب أن تكون قابلة للمراقبة وإعادة التشغيل، وأن تسجل الأخطاء وتتحقق من المخطط والجودة وتحافظ على أصل البيانات.

في ETL يحدث الاستخلاص ثم التحويل ثم التحميل إلى الوجهة. أما ELT فيتم تحميل البيانات أولًا ثم تحويلها داخل منصة تحليلية قوية. الاختيار يعتمد على الحوكمة، وحجم البيانات، وقدرة الوجهة، ومتطلبات الاحتفاظ بالبيانات الخام.
| البعد | معالجة الدفعات | معالجة التدفقات |
|---|---|---|
| زمن الوصول | بعد تجميع فترة من البيانات | أثناء وصول الأحداث أو بعد تأخير قصير |
| الوحدات | ملفات أو أقسام زمنية كبيرة | أحداث مستمرة |
| الاستخدامات | تقارير يومية وإعادة حساب تاريخي | تنبيهات ومراقبة وتخصيص لحظي |
| التحديات | زمن تشغيل طويل وعمليات Shuffle كبيرة | ترتيب الأحداث والتأخر وإعادة التشغيل والضغط العكسي |
زمن الحدث هو الوقت الذي وقع فيه الحدث في المصدر، بينما زمن المعالجة هو الوقت الذي عالجه فيه النظام. في التطبيقات الحقيقية قد تصل الأحداث متأخرة أو خارج ترتيبها، ولهذا تحتاج الأنظمة التدفقية إلى سياسات نوافذ وحدود مائية ومعالجة واضحة للتكرارات.

يقدم Apache Kafka موضوعات مقسمة إلى تجزئات. يكتب المنتجون الأحداث، ويقرأها المستهلكون، ويمكن لمجموعة مستهلكين توزيع التجزئات بينها لتحقيق التوازي. يساعد المفتاح في اختيار التجزئة، ومن ثم يمكن الحفاظ على ترتيب الأحداث داخل التجزئة نفسها. أما الضمانات مثل المعالجة مرة واحدة أو على الأقل مرة فتتطلب فهمًا متكاملًا لسلوك المنتج والمستهلك والتخزين والوجهة، ولا تتحقق بمجرد اختيار اسم أداة.
تنسيقات التخزين والتحسين التحليلي
تؤثر صيغة التخزين في الأداء بقدر تأثير المحرك. تنسيق Parquet عمودي، ولذلك يمكن للمحرك قراءة الأعمدة المطلوبة فقط والاستفادة من الترميز والضغط والإحصاءات. ويعد التقسيم حسب تاريخ أو منطقة مفيدًا عندما يتوافق مع أنماط الاستعلام، لكن الإفراط في التقسيم قد ينتج عددًا هائلًا من الملفات الصغيرة.
من التقنيات المهمة أيضًا الدفع بالمرشحات لتقليل القراءة، والتقليم لتجنب أقسام غير مطلوبة، والتجميع المسبق عندما تتكرر الاستعلامات نفسها. ويجب مراقبة انحراف البيانات؛ فإذا احتوت تجزئة واحدة على نسبة كبيرة من السجلات فقد تبقى مهمة واحدة تعمل بعد انتهاء بقية المهام، فيضيع أثر التوازي.
مجموعة بيانات تعليمية مصغرة
يوضح الجدول التالي سجلات اصطناعية صغيرة تشبه تيار تنقل حضري. الغرض هو فهم المخطط، وليس تمثيل مدينة حقيقية.
| معرّف الرحلة | وقت البداية | منطقة الانطلاق | مدة الرحلة بالدقائق | نوع المركبة |
|---|---|---|---|---|
| رحلة ألف | 08:05 | المركز | 18 | حافلة |
| رحلة باء | 08:07 | الجامعة | 11 | مركبة مشتركة |
| رحلة جيم | 08:09 | المركز | 27 | حافلة |
| رحلة دال | 08:14 | المحطة | 9 | مركبة مشتركة |
| رحلة هاء | 08:16 | الجامعة | 15 | حافلة |
يمكنك استخدام هذه السجلات لتحديد أكثر مناطق الانطلاق تكرارًا، ومتوسط المدة، وكيف ستختار مفتاح التجزئة إذا زاد معدل الأحداث إلى ملايين السجلات. لاحظ أن اختيار المنطقة مفتاحًا قد يسبب انحرافًا إذا كانت منطقة المركز مهيمنة على البيانات.
من البيانات إلى التحليلات والقرارات
يمكن تقسيم الأسئلة التحليلية إلى أربعة أنماط مترابطة. التحليل الوصفي يجيب عما حدث، مثل عدد الرحلات لكل ساعة. التحليل التشخيصي يبحث عن سبب التغير، مثل ارتباط التأخير بمنطقة أو وقت أو حالة تشغيلية. التحليل التنبؤي يقدّر ما قد يحدث، مثل الطلب المتوقع. التحليل التوجيهي يقارن البدائل ويقترح إجراءً ضمن قيود محددة.
في التعلم الآلي واسع النطاق، لا يكفي تدريب نموذج؛ يجب بناء ميزات موثوقة، ومنع تسرب المعلومات من المستقبل، وتقسيم البيانات زمنيًا عند الحاجة، ومراقبة الانحياز وتغير التوزيع. كما يجب أن تكون المقاييس مرتبطة بهدف حقيقي. نموذج دقيق إحصائيًا قد يكون غير مفيد إذا كان بطيئًا أو مكلفًا أو غير عادل أو يصعب تفسيره في سياق عالي المخاطر.
دراسات حالة وتطبيقات
الحكومة والتنقل الحضري
تنشر لجنة سيارات الأجرة والليموزين في مدينة نيويورك بيانات رحلات شهرية بصيغة Parquet، ويمكن استخدامها تعليميًا لدراسة الطلب المكاني والزمني، وتوزيع مدد الرحلات، وتغير الأنماط على مدار اليوم. في مشروع جامعي يمكن بناء خط يبدأ من الملفات الشهرية، ثم يتحقق من المخطط والقيم المفقودة، ويقسم البيانات حسب الشهر، ويستخدم Spark لتنفيذ تجميعات، ثم يقدم النتائج في لوحة معلومات.
مجموعة بيانات رحلات سيارات الأجرة والمركبات المأجورة
هذه الحالة توضح أيضًا قيمة الحوكمة: البيانات التشغيلية قد تحتوي متغيرات حساسة أو شبه معرفّة، ولذلك يجب الالتزام بالحد الأدنى من البيانات اللازمة والتحقق من شروط النشر والاستخدام قبل الربط بمصادر أخرى.
الأعمال والتجارة الرقمية
تخيل شركة تجارة إلكترونية تستقبل أحداث مشاهدة منتج، وإضافة إلى السلة، وشراء، وإرجاع. يمكن نشر الأحداث إلى Kafka، ثم إنشاء مسارين: مسار تدفقي لحساب مؤشرات حديثة واكتشاف ارتفاع غير عادي في الأخطاء، ومسار دفعي يحتفظ بتاريخ طويل في بحيرة بيانات لإجراء تحليل شرائح العملاء وبناء نماذج طلب.
تحدي هذه البنية ليس السرعة فقط. يجب تعريف معنى الحدث ومخططه، ومنع العد المزدوج عند إعادة الإرسال، وربط المعاملات بحذر، وتحديد مدة الاحتفاظ، ومراقبة كلفة التخزين والحوسبة. كما ينبغي فصل معرفات التحليل عن البيانات الشخصية المباشرة قدر الإمكان.
العلوم والحوسبة الموزعة
تنتج تجارب مصادم الهادرونات الكبير في CERN كميات هائلة من بيانات التصادم والمحاكاة، وتستخدم شبكة الحوسبة العالمية للمصادم WLCG موارد موزعة عالميًا لتخزين البيانات وتوزيعها وتحليلها. هذه مثال واضح على أن البيانات الضخمة قد تكون مشكلة علمية في النقل والتخزين والجدولة وإعادة الإنتاج، لا مجرد مشكلة لوحة معلومات.
شبكة الحوسبة العالمية لمصادم الهادرونات الكبير
يمكن لطلاب الجامعة استخدام مجموعات CERN المفتوحة للتدرب على قراءة البيانات العلمية والميتاداتا، وفهم الفرق بين بيانات خام وبيانات مُعاد بناؤها وعينات تعليمية، ثم توثيق خطوات التحليل بحيث يمكن لطالب آخر إعادة النتيجة.
البنية التحتية الذكية وإنترنت الأشياء
في بنية تحتية ذكية قد تنتج الحساسات قياسات حركة وبيئة وطاقة وحالة أصول بصورة مستمرة. يتطلب النظام طبقة اتصال واستيعاب، وتحققًا من صحة القياسات، وتخزينًا زمنيًا أو كائنيًا، ومعالجة تدفقية لاكتشاف الحالات غير الطبيعية، وتحليلات تاريخية للصيانة والتخطيط.
مثال: في مراقبة مضخات مياه، قد يرسل كل جهاز درجة الحرارة والاهتزاز والضغط. يمكن للدفق اللحظي اكتشاف نمط يتجاوز حدودًا تشغيلية، بينما تحلل الدفعات أشهرًا من البيانات للبحث عن مؤشرات مبكرة للعطل. القرار الهندسي المهم هو تحديد الكمون المقبول، ومعدل البيانات، وسياسة التعامل مع انقطاع الاتصال، ومن يملك حق الوصول إلى القياسات.
جودة البيانات والحوكمة والأمن
يمكن لمنصة سريعة أن تنتج قرارًا سيئًا إذا كانت البيانات غير موثوقة. لذلك تُقاس الجودة بأبعاد مثل الاكتمال والدقة والاتساق والحداثة والتفرد. ويجب تسجيل أصل البيانات بحيث يمكن معرفة من أين جاء الحقل وما التحويلات التي مر بها، مع إدارة نسخ المخططات والميتاداتا.
تشمل الحوكمة تحديد مالكي البيانات، وسياسات الاحتفاظ، ومستويات الوصول، وتعريف المصطلحات، وتوثيق الاستخدام المقبول. وتشمل الحماية التشفير أثناء النقل والتخزين، والمصادقة والتفويض، وإدارة الأسرار، والتدقيق، وتقليل البيانات، وإخفاء أو تجميع المعرفات عندما يكون ذلك مناسبًا.
في المشروعات الحكومية أو الصحية أو التعليمية يجب ألا يُفهم امتلاك القدرة التقنية على الربط بين مصادر متعددة بوصفه إذنًا للقيام بذلك. ينبغي أن يكون هناك أساس قانوني وأخلاقي واضح، وغرض محدد، وتناسب بين البيانات المستخدمة والهدف، وتقييم لمخاطر إعادة التعرف والتحيز.
الأداء والموثوقية والمفاهيم الخاطئة
المزيد من العقد لا يعني تلقائيًا أداء أفضل؛ فالعمل الصغير قد يتباطأ بسبب كلفة التنسيق. والاحتفاظ في الذاكرة ليس دائمًا أفضل؛ فقد يؤدي ضغط الذاكرة إلى إخراج بيانات أو فشل مهام. والتدفق لا يعني أن كل قرار يجب أن يكون لحظيًا؛ أحيانًا تكفي دفعة كل ساعة بتكلفة أقل وتعقيد أقل.
ومن المهم فهم أن نظرية CAP لا تعني اختيار خاصيتين من ثلاث في كل لحظة بصورة مبسطة. عند حدوث انقسام شبكي حقيقي يظهر التبادل بين الحفاظ على اتساق قوي والاستمرار في قبول العمليات، وتختلف الاستراتيجيات بحسب نوع البيانات ومتطلبات التطبيق.
عند تشخيص بطء مهمة موزعة اسأل: هل توجد تجزئة ساخنة؟ هل هناك ملفات صغيرة كثيرة؟ هل يحدث Shuffle ضخم؟ هل يتطلب الاستعلام أعمدة لا حاجة لها؟ هل البيانات مضغوطة ومقسمة بصورة مناسبة؟ هل يسبب مصدر خارجي ضغطًا عكسيًا؟ هذه الأسئلة غالبًا أكثر فائدة من زيادة الموارد مباشرة.
منهج عملي لتصميم منصة
ابدأ بتعريف نتيجة قابلة للقياس: تقرير يومي، تنبيه في ثوان، نموذج تنبؤ، أو واجهة بيانات. ثم قدّر معدل البيانات وحجمها ومدة الاحتفاظ، وحدد متطلبات الكمون والتوفر والتعافي. بعد ذلك اختر نمط الاستيعاب والتخزين والمعالجة، وصمم مخططًا للعقود بين المنتجين والمستهلكين، وأضف اختبارات جودة ومراقبة منذ البداية.
نفذ نموذجًا أوليًا على عينة صغيرة، ثم اختبره ببيانات أكبر وتوزيع واقعي للأحمال. قس زمن التنفيذ وحجم القراءة والكتابة ومعدل الفشل والكلفة. لا تنتقل إلى الإنتاج قبل وجود طريقة لإعادة المعالجة، وتتبع الإصدارات، وإيقاف خط معيب، واسترجاع نتائج يمكن تدقيقها.
مصادر موصى بها وبيانات مفتوحة
للتوسع في الدراسة يمكنك الرجوع إلى المصادر الآتية:
- تعريفات إطار NIST للبيانات الضخمة
- البنية المرجعية للبيانات الضخمة لدى NIST
- وثائق Apache Hadoop
- الموقع الرسمي لـApache Spark
- وثائق Apache Kafka
- بيانات الرحلات المفتوحة لمدينة نيويورك
- بوابة CERN للبيانات المفتوحة
مهام تفاعلية
اختبار: اختبر معرفتك
متى تكون مشكلة البيانات أقرب إلى مجال البيانات الضخمة؟ (عندما تتطلب خصائص الحجم والسرعة والتنوع بنية قابلة للتوسع) (!عندما يكون الملف كبيرًا بصريًا على الشاشة) (!عندما تستخدم البيانات جدولًا واحدًا فقط) (!عندما يكون عدد الأعمدة قليلًا)
ما الغرض الأساسي من تجزئة البيانات في نظام موزع؟ (توزيع البيانات والعمل لتمكين المعالجة المتوازية) (!تحويل كل القيم إلى نصوص) (!حذف السجلات القديمة تلقائيًا) (!منع استخدام أكثر من عقدة)
ما الدور الأساسي لـNameNode في HDFS؟ (إدارة بيانات وصف نظام الملفات ومواقع الكتل) (!تنفيذ جميع مهام التحليل الإحصائي) (!عرض لوحات المعلومات للمستخدمين) (!تشفير كل سجل داخل التطبيق)
ما الذي يحدث في مرحلة Shuffle في MapReduce؟ (تجميع ونقل النتائج الوسيطة بحسب المفاتيح) (!إيقاف جميع العقد بعد مرحلة Map) (!تحويل البيانات إلى صور) (!حذف المفاتيح قبل مرحلة Reduce)
لماذا قد يكون Spark مناسبًا لأعمال تحليلية متعددة المراحل؟ (لأنه ينظم خطط تنفيذ موزعة ويدعم واجهات تحليل متعددة) (!لأنه يعمل على عقدة واحدة فقط) (!لأنه يلغي الحاجة إلى تخزين البيانات) (!لأنه يمنع تنفيذ SQL)
ما فائدة التجزئات في موضوع Kafka؟ (تمكين التوازي وتوزيع الأحداث بين وحدات تخزين ومعالجة) (!ضمان ترتيب عالمي لكل أحداث المنصة) (!تحويل جميع الأحداث إلى ملفات صور) (!منع وجود أكثر من مستهلك)
ما الفرق الجوهري بين ETL وELT؟ (في ELT يتم التحميل قبل تنفيذ التحويلات الرئيسية في الوجهة) (!في ELT لا توجد مرحلة تحميل) (!في ETL لا توجد مصادر بيانات) (!في ETL يجب أن تكون البيانات متدفقة دائمًا)
ما المقصود بانحراف البيانات في المعالجة الموزعة؟ (تركز نسبة كبيرة من السجلات في عدد قليل من التجزئات) (!توزيع متساو تمامًا للسجلات) (!تشفير البيانات قبل التخزين) (!تغيير أسماء الأعمدة فقط)
أي استخدام يناسب بيانات الرحلات الحضرية المفتوحة؟ (تحليل الطلب المكاني والزمني على خدمات النقل) (!استنتاج كلمات مرور المستخدمين) (!إلغاء الحاجة إلى التحقق من الجودة) (!ضمان دقة أي نموذج دون اختبار)
ما الفائدة الأساسية من تتبع أصل البيانات؟ (معرفة مصدر البيانات والتحويلات التي مرت بها) (!زيادة عدد النسخ دون هدف) (!حذف الميتاداتا) (!استبدال سياسات الوصول)
لعبة الذاكرة
| HDFS | نظام ملفات موزع يقسم البيانات ويخزنها عبر عقد متعددة |
| التجزئة | تقسيم مجموعة البيانات إلى أجزاء قابلة للتوزيع والمعالجة المتوازية |
| التكرار | الاحتفاظ بنسخ إضافية لتحسين التوفر وتحمل الأعطال |
| Apache Spark | محرك موزع للتحليلات ومعالجة البيانات على نطاق واسع |
| Apache Kafka | منصة موزعة لنشر أحداث متدفقة وتخزينها واستهلاكها |
| أصل البيانات | سجل يوضح مصدر البيانات والتحويلات التي مرت بها |
| Parquet | تنسيق تخزين عمودي ملائم للتحليلات واسعة النطاق |
السحب والإفلات
| طابق المرحلة مع وظيفتها الصحيحة. | خط البيانات |
|---|---|
| الاستخلاص | جمع البيانات من الأنظمة والمصادر الأصلية |
| الاستيعاب | إدخال البيانات إلى المنصة على شكل دفعات أو أحداث |
| التحقق | فحص المخطط والقيم والقواعد المتفق عليها |
| التحويل | تنظيف البيانات وربطها واشتقاق حقول جديدة |
| التحليل | حساب المؤشرات أو تدريب النماذج واختبار الفرضيات |
| التقديم | إتاحة النتائج عبر تقارير أو لوحات أو واجهات خدمات |
كلمات متقاطعة
| التجزئة | ما العملية التي تقسم البيانات إلى أجزاء موزعة لزيادة التوازي؟ |
| التكرار | ما الأسلوب الذي يحتفظ بنسخ إضافية من البيانات لتحمل الأعطال؟ |
| التدفق | ما نمط المعالجة الذي يتعامل مع أحداث تصل بصورة مستمرة؟ |
| الكمون | ما المصطلح الذي يصف التأخير بين وقوع الحدث وظهور النتيجة؟ |
| الحوكمة | ما الإطار الذي يحدد الملكية والسياسات والوصول والاستخدام المسؤول للبيانات؟ |
| باركيه | ما التنسيق العمودي الشائع لتخزين البيانات التحليلية واسعة النطاق؟ |
مهام مفتوحة
سهل
- خريطة خصائص البيانات: أنشئ خريطة مفاهيم من صفحة واحدة تشرح الحجم والسرعة والتنوع والقيمة، واربط كل خاصية بمثال جامعي أو حكومي أو تجاري.
- مقارنة الدفعة والتدفق: اكتب جدولًا يقارن معالجة الدفعات والتدفقات من حيث الكمون والكلفة والتعقيد وحالات الاستخدام، ثم اختر نمطًا لتطبيق مراقبة حساسات.
- قراءة بنية خط بيانات: ارسم مخططًا بالعربية لمسار بيانات من مصدر إلى استيعاب ثم تخزين ومعالجة وتحليل وتقديم، وأضف نقطة تحقق جودة في كل مرحلة مناسبة.
- استكشاف ملف باركيه: استخدم عينة بيانات مفتوحة أو اصطناعية لفحص المخطط والأعمدة والقيم المفقودة، ثم سجل ثلاثة أسباب تجعل القراءة العمودية مفيدة للتحليل.
متوسط
- تحليل رحلات حضرية: حمّل عينة من بيانات الرحلات المفتوحة، واحسب عدد الرحلات ومتوسط المدة حسب الساعة أو المنطقة، ثم ناقش أثر القيم المفقودة والقيم الشاذة.
- محاكاة التجزئة: أنشئ مجموعة سجلات اصطناعية ووزعها على عدة تجزئات باستخدام مفتاحين مختلفين، ثم قارن توازن الحمل واشرح متى يظهر انحراف البيانات.
- تصميم خط أحداث: صمم بنية تستخدم Kafka لاستيعاب أحداث تطبيق، ثم حدد الموضوعات والمفاتيح والمستهلكين وسياسة إعادة المحاولة وطريقة منع العد المزدوج.
- مقابلة مهندس بيانات: أجر مقابلة قصيرة مع مختص أو عضو هيئة تدريس حول أكبر تحديين في تشغيل خطوط البيانات، ثم لخص النتائج دون جمع أو نشر بيانات شخصية غير لازمة.
متقدم
- بناء معالجة موزعة: نفذ تحليلًا باستخدام Spark على عينة كبيرة نسبيًا، وقارن زمن التنفيذ قبل وبعد تحسين التقسيم أو تقليل الأعمدة المقروءة، ثم فسر القياسات.
- دراسة بيانات CERN: اختر مجموعة بيانات تعليمية مفتوحة من CERN، واقرأ الميتاداتا، ونفذ تحليلًا قابلاً لإعادة الإنتاج، ثم وثق خطوات الحصول على النتيجة وحدودها.
- تقييم حوكمة منصة بيانات: أنشئ قائمة تدقيق تشمل الملكية والاحتفاظ والوصول والتشفير وأصل البيانات وجودتها والخصوصية، وطبقها على سيناريو حكومي أو جامعي.
- مشروع بنية تحتية ذكية: صمم نموذجًا متكاملًا لنظام حساسات ذكي يضم الاستيعاب والتخزين والمعالجة التدفقية والتحليل التاريخي والتنبيه، ثم قدم المخطط في عرض أو فيديو قصير يبرر القرارات المعمارية.
مجالات تعلم مرتبطة
يرتبط هذا الموضوع بعلوم الحاسوب والإحصاء وبحوث العمليات وهندسة البرمجيات والحوسبة السحابية والأمن السيبراني والتخطيط الحضري والبحث العلمي. ويظهر مهنيًا في أدوار مهندس البيانات، ومهندس المنصات، ومحلل البيانات، وعالم البيانات، ومهندس التعلم الآلي، ومهندس موثوقية الأنظمة.
مسرد
| المصطلح | التعريف |
|---|---|
| البيانات الضخمة | بيانات تتطلب بسبب خصائصها بنى وأساليب قابلة للتوسع تتجاوز المقاربات التقليدية في سياق معين |
| الحوسبة الموزعة | تنفيذ العمل عبر عدة عقد متصلة تتعاون لإكمال مهمة واحدة أو خدمة مشتركة |
| التجزئة | تقسيم البيانات إلى أجزاء مستقلة نسبيًا توزع بين العقد أو المهام |
| التكرار | تخزين نسخ متعددة من البيانات أو الحالة لرفع التوفر وتحمل الأعطال |
| الكمون | الزمن بين حدث أو طلب وبين وصول الاستجابة أو النتيجة المطلوبة |
| الإنتاجية | كمية البيانات أو عدد العمليات التي يستطيع النظام معالجتها في وحدة زمن |
| معالجة الدفعات | معالجة بيانات مجمعة على فترات أو أحجام محددة بدل التعامل مع كل حدث فور وصوله |
| معالجة التدفقات | معالجة سلسلة مستمرة من الأحداث مع التركيز على النتائج ذات الكمون المنخفض |
| ETL | استخلاص البيانات ثم تحويلها ثم تحميلها إلى الوجهة التحليلية |
| ELT | استخلاص البيانات ثم تحميلها إلى منصة قادرة على تنفيذ التحويلات داخلها |
| Parquet | تنسيق ملفات عمودي مصمم لقراءة تحليلية فعالة وضغط مناسب للبيانات الجدولية |
| أصل البيانات | معلومات توثق المصدر والمسار والتحويلات التي خضعت لها البيانات |
| انحراف البيانات | عدم توازن توزيع السجلات أو العمل بين التجزئات بما يسبب عقدًا أو مهام بطيئة |
| الحوكمة | سياسات ومسؤوليات وعمليات لإدارة جودة البيانات وملكيتها ووصولها واستخدامها طوال دورة حياتها |
مشروعات aiMOOC
MOOCwiki · Deutsch
Nach dem Lernen ist vor dem Lernen
Entdecke direkt den nächsten Lernkurs. Weitere Inhalte erscheinen, wenn Du weiter nach unten scrollst.
Zur MOOCwiki-HauptseiteMediathek
Mediathek
Mediathek wird aus dem Wiki geladen ...
Keine passenden Inhalte gefunden. Bitte ändere Suche oder Filter.
NEWSLernweltNOAH fragen