Zum Inhalt springen

Arabic:معالجة اللغة العربية بالحاسوب

Aus MOOCsWiki Staging
Version vom 29. August 2026, 11:44 Uhr von Glanz (Diskussion | Beiträge) (aiMOOC über GPT aiMOOC Action erstellt)
(Unterschied) ← Nächstältere Version | Aktuelle Version (Unterschied) | Nächstjüngere Version → (Unterschied)
aiMOOC-Siegel

معالجة اللغة العربية بالحاسوب



مقدمة

تعني معالجة اللغة العربية بالحاسوب بناء تمثيلات وخوارزميات تمكّن الحاسوب من تحليل العربية المكتوبة والمنطوقة، واسترجاع المعلومات منها، وتصنيفها، وترجمتها، وتوليدها، والتفاعل معها. يجمع هذا المجال بين اللسانيات الحاسوبية والذكاء الاصطناعي وتعلم الآلة وعلوم البيانات وهندسة البرمجيات.

تحتاج العربية إلى عناية خاصة لأنها لغة غنية صرفيًّا، وكثير من نصوصها الرقمية غير مشكول، وتلتصق فيها حروف العطف والجر والتعريف والضمائر بالكلمة، كما تتعايش العربية الفصحى الحديثة مع طيف واسع من اللهجات المحلية ومع ظواهر المزج اللغوي والكتابة العربية بالحروف اللاتينية. لذلك لا يوجد خط أنابيب واحد يصلح لكل تطبيق؛ فالقرار الذي يحسن محرك بحث قد يطمس معلومة يحتاج إليها محلل صرفي أو نظام ترجمة.

خريطة عامة توضح الامتداد الجغرافي لاستعمال العربية بدرجات رسمية مختلفة
الامتداد الجغرافي الواسع لاستعمال العربية يذكّر بأن البيانات العربية ليست كتلة لغوية متجانسة. الخريطة لا تمثل حدود اللهجات.

يقدّم التسجيل الآتي ندوة علمية عربية حول واقع المعالجة الآلية للعربية وآفاقها:


المتطلبات السابقة

يفيدك أن تكون ملمًّا بأساسيات البرمجة بلغة بايثون، وبمبادئ الاحتمالات والجبر الخطي، وبمفاهيم التدريب والاختبار في تعلم الآلة. أما المعرفة اللسانية المتقدمة فليست شرطًا؛ إذ يعرّف المقرر المفاهيم الصرفية والصوتية الضرورية عند الحاجة.


أهداف التعلم

بنهاية المقرر ينبغي أن تكون قادرًا على تفسير المشكلات الخاصة بتمثيل النص العربي وتقطيعه وتطبيعه، والتمييز بين التقطيع السطحي والتجزئة الصرفية، وتحليل أثر غياب التشكيل والغنى الصرفي في الغموض، واختيار موارد مناسبة للفصحى واللهجات والكلام، وبناء تجربة أولية في التصنيف أو الاسترجاع، وتفسير مبادئ التعرف الآلي على الكلام والترجمة الآلية، وتقييم النماذج بمقاييس كمية مع تحليل أخطاء نوعي، ونقد الانحيازات الناتجة عن البيانات واللهجة والمجال.


العربية بوصفها بيانات رقمية


الترميز والتطبيع

يعتمد النص العربي الحديث عادة على يونيكود، لكن الشكل المرئي المتشابه لا يعني دائمًا تمثيلًا رقميًّا متطابقًا. قد تظهر فروق في الهمزات، والألف المقصورة، والياء، والتطويل، والتشكيل، وعلامات الترقيم العربية واللاتينية، ومحارف العرض. لهذا تبدأ كثير من المشاريع بفحص الترميز ثم تطبيق تطبيع مضبوط بحسب المهمة.

التطبيع ليس تنظيفًا محايدًا. مثلًا، توحيد أ وأ وإ وآ إلى ا قد يحسن المطابقة في بعض تطبيقات الاسترجاع، لكنه يزيل معلومة إملائية قد تكون مفيدة للتدقيق أو التحليل اللغوي. وكذلك حذف التشكيل قد يزيد التغطية في البحث، لكنه يطمس فروقًا دلالية ونحوية. احتفظ دائمًا بنسخة خام من البيانات، وسجّل التحويلات التي طبقتها حتى يمكن إعادة التجربة.

الحروف الأساسية في الأبجدية العربية مرتبة في مجموعات
الحروف العربية هي أساس التمثيل الكتابي، لكن المعالجة الحاسوبية تتعامل أيضًا مع الحركات والعلامات والرموز والسياق.

هذا مثال عملي قصير باستخدام حزمة كامِل تولز لتوحيد يونيكود ثم فصل الكلمات وعلامات الترقيم:

# مثال بلغة بايثون
from camel_tools.utils.normalize import normalize_unicode, normalize_alef_ar
from camel_tools.tokenizers.word import simple_word_tokenize

النص = "إِنَّ اللغةَ العربيةَ غنيّةٌ، وبها لهجاتٌ كثيرة."
النص_الموحّد = normalize_unicode(النص)
نسخة_للبحث = normalize_alef_ar(النص_الموحّد)
الوحدات = simple_word_tokenize(نسخة_للبحث)
print(الوحدات)

المثال يفصل علامات الترقيم عن الكلمات، لكنه لا يفصل كل اللواصق الصرفية. وهذه نقطة مهمة: التقطيع إلى وحدات سطحية يختلف عن التجزئة الصرفية التي قد تفصل الواو والباء وأداة التعريف والضمير المتصل عن الجذع.


من النص الخام إلى نموذج لغوي

يمكن تصور خط أنابيب عام على النحو الآتي، مع اختلاف التفاصيل باختلاف المهمة:

المدخل المعالجة الأولية التحليل أو التمثيل النموذج المخرج
نص أو كلام عربي فحص الترميز والتطبيع والتقطيع صرف أو سمات أو تمثيلات متجهية نموذج إحصائي أو عصبي تصنيف أو استرجاع أو ترجمة أو تفريغ

لا ينبغي تنفيذ المراحل آليًّا دون فحص. ابدأ بعينة صغيرة، واكتب اختبارات لحالات مثل الأرقام العربية والمشرقية، والرموز التعبيرية، والوسوم، والروابط، والكلمات المختلطة عربيًّا ولاتينيًّا، ثم قرر ما تريد الاحتفاظ به.


التقطيع والصرف والتشكيل


لماذا الصرف العربي محوري

تنتظم العربية في قدر كبير من مفرداتها حول علاقات بين الجذر والوزن والزوائد، لكنها لا تختزل في الجذر وحده. الكلمة الحاسوبية المفيدة قد تحتاج إلى معلومات عن اللمّة، ونوع الكلمة، والجنس، والعدد، والشخص، والزمن أو الجهة، واللواصق. وتزيد اللواصق من عدد الأشكال السطحية؛ فصيغة واحدة مكتوبة قد تجمع حرف عطف وحرف جر وأداة تعريف واسمًا وضميرًا متصلًا.

غياب الحركات في معظم الكتابة اليومية يخلق غموضًا واسعًا. سلسلة مثل «علم» يمكن أن ترتبط بقراءات ووظائف متعددة يحددها السياق. لذلك يفرق النظام الجيد بين التحليل الصرفي الذي يولد تحليلات ممكنة وإزالة الغموض الصرفي التي تختار التحليل الأرجح في سياق الجملة.

مثال على استدعاء محلل صرفي في كامِل تولز:

from camel_tools.morphology.database import MorphologyDB
from camel_tools.morphology.analyzer import Analyzer

قاعدة = MorphologyDB.builtin_db()
المحلل = Analyzer(قاعدة)
التحليلات = المحلل.analyze("شارع")

for تحليل in التحليلات[:3]:
    print(تحليل.get("lex"), تحليل.get("pos"), تحليل.get("root"))

قد يعيد المحلل أكثر من احتمال. لا تفترض أن أول تحليل هو الصحيح دائمًا؛ إزالة الغموض تحتاج إلى السياق أو إلى نموذج مخصص لذلك.


التشكيل الآلي

التشكيل الآلي مهمة استرجاع للحركات المناسبة من سياق غير مشكول. وهي مهمة مهمة لتحويل النص إلى كلام، وتعليم القراءة، وبعض تطبيقات التحليل الدلالي. توفر مدونة تشكيلة موردًا واسعًا من النصوص العربية المشكلة؛ وتصف الورقة الأصلية المدونة بأنها تضم نحو خمسة وسبعين مليون كلمة مشكلة بالكامل، مأخوذة أساسًا من سبعة وتسعين كتابًا من العربية الكلاسيكية والحديثة. هذه الوفرة لا تلغي انحياز المجال؛ فالنصوص التراثية ليست بديلًا كاملًا عن الأخبار أو المحادثات أو اللهجات.

عند تقييم نظام تشكيل لا يكفي عد الخطأ على مستوى الحرف فقط؛ ينبغي أن تسأل أيضًا: هل تحسب حركة الحرف الأخير؟ هل تعاقب النموذج على علامات اختيارية؟ وهل مجموعة الاختبار من المجال نفسه الذي تدرب عليه النموذج؟


الفصحى واللهجات والتنوع اللغوي

لا توجد «لهجة عربية واحدة» مقابل الفصحى، بل طيف واسع من الأنماط المحلية والاجتماعية والأسلوبية. قد يكتب المستخدم جملة فصحى ثم ينتقل إلى لهجة محلية أو إلى كلمة فرنسية أو إنجليزية، وقد يكتب العربية بحروف لاتينية وأرقام. لهذا فإن تصنيف النص إلى بلد واحد قد يكون مفيدًا عمليًّا في بعض التطبيقات لكنه يظل تبسيطًا لسلوك لغوي أكثر تعقيدًا.

من الموارد المهمة مادار، وهو مشروع قدّم مدونة موازية في مجال السفر تغطي لهجات خمس وعشرين مدينة عربية، ومعجمًا مفاهيميًّا مرتبطًا بها. يتيح ذلك مقارنة التعبير عن المعنى نفسه بين مدن متعددة بدل افتراض لهجة وطنية موحدة. كما توفر مجموعة قادي بيانات لتحديد اللهجة على مستوى البلد من منشورات شبكات اجتماعية، وتضم نحو خمسمئة وأربعين ألف منشور من ثمانية عشر بلدًا عربيًّا. لكن تسميات البلد ليست مرادفًا كاملًا للهجة، كما أن طريقة جمع منشورات الشبكات الاجتماعية تفرض اعتبارات للخصوصية وبقاء المحتوى وتحيز المستخدمين.

في مشروع جامعي مسؤول، افحص توزيع البلدان والمناطق والجنس والعمر عندما تكون هذه المعلومات قانونية ومتاحة أخلاقيًّا، ولا تجعل أداء النموذج المتوسط يخفي فشلًا شديدًا في لهجات قليلة التمثيل. من الأفضل الإبلاغ عن الأداء لكل مجموعة، وإضافة اختبار عبر المجالات: درّب على منشورات اجتماعية مثلًا ثم اختبر على حوار أو أخبار عندما يكون ذلك مناسبًا.


مثال مفاهيمي لتحديد اللهجة

يمكن تمثيل لهجات متقاربة بسمات حرفية قصيرة لأنها تلتقط اختلافات في الإملاء واللواصق وبعض الأنماط المحلية. المثال التالي تعليمي فقط وليس نموذجًا جاهزًا للنشر:

from sklearn.feature_extraction.text import TfidfVectorizer
from sklearn.linear_model import LogisticRegression

النصوص = ["شو عم تعمل اليوم", "واش غادي للجامعة", "إيه الأخبار النهارده"]
التسميات = ["شامي", "مغاربي", "مصري"]

المحوّل = TfidfVectorizer(analyzer="char_wb", ngram_range=(3, 5))
السمات = المحوّل.fit_transform(النصوص)
النموذج = LogisticRegression().fit(السمات, التسميات)
print(النموذج.predict(المحوّل.transform(["شو بدك تعمل"])))

لا تتعلم من هذا المثال أن ثلاث جمل تكفي أو أن هذه الفئات حدود صلبة. في تجربة بحثية حقيقية تحتاج إلى بيانات أكبر، وتقسيم يمنع تسرب الكاتب بين التدريب والاختبار، وتحليل أخطاء يراعي الانتقال بين الفصحى واللهجة والمزج اللغوي.


معالجة الكلام العربي

تحويل الكلام العربي إلى نص يمر عادة من إشارة صوتية إلى تمثيل صوتي ثم نموذج يتنبأ بوحدات نصية، مع الاستفادة من سياق لغوي. وتظهر تحديات خاصة عند تداخل المتكلمين، والضوضاء، واختلاف اللهجات، وأسماء الأشخاص والأماكن، والمزج بين العربية ولغات أخرى.

مطياف صوتي يبين تغير طاقة الكلام عبر الزمن والتردد
مثال عام لمطياف صوتي: يمثّل المحور الأفقي الزمن والرأسي التردد، وتوضح درجات الشدة توزيع الطاقة الصوتية.

توفر كومن فويس تسجيلات عربية يقود جمعها المجتمع ويمكن استعمالها في بحوث التعرف الآلي على الكلام وفق شروط الإصدار. أما تحدي إم جي بي اثنان فقدم نحو ألف ومئتي ساعة من البث العربي من تسعة عشر برنامجًا تلفزيونيًّا مع تفريغات خفيفة الإشراف؛ وقد ركز أصلًا على صعوبة تنوع اللهجات في البث. توضح هذه الموارد أن «بيانات عربية كثيرة» لا تعني بالضرورة توازنًا لهجيًّا أو مجاليًّا.

مرحلة الكلام سؤال بحثي
التسجيل هل الضوضاء والأجهزة والبيئات ممثلة؟
التجزئة الصوتية هل حدود المقاطع والمتكلمين موثوقة؟
التفريغ هل سياسة كتابة اللهجات والترددات والرموز موحدة؟
التدريب هل النموذج يرى لهجات ومتحدثين من خارج مجموعة الاختبار؟
التقييم هل معدل خطأ الكلمات يخفي أخطاء خطرة في الأسماء أو اللهجات؟

يشيع معدل خطأ الكلمات في تقييم التعرف على الكلام، لكنه لا يكفي وحده. قد يكون خطأ واحد في اسم دواء أو اسم شخص أهم من عدة أخطاء في كلمات وظيفية؛ لذا أضف تحليلًا نوعيًّا حسب نوع الخطأ واللهجة والمجال.


الترجمة الآلية والنماذج اللغوية

تحتاج الترجمة من العربية وإليها إلى قرارات تتجاوز استبدال الكلمات. يجب على النظام معالجة الضمائر والاتفاق النحوي والأسماء العلم والسياق، وقد يضطر إلى الترجمة من لهجة إلى فصحى أو من عربية مختلطة بلغة أخرى. وتظهر صعوبة إضافية عندما تكون الجملة غير مشكلة أو تحتمل أكثر من تحليل صرفي.

تعتمد النماذج العصبية الحديثة عادة على وحدات دون الكلمة. هذا مفيد للكلمات النادرة، لكنه قد يقسم اللواصق العربية بطريقة لا تطابق الحدود الصرفية. لذلك افحص ناتج المقطّع بدل اعتباره تفصيلًا تقنيًّا. يمكن أحيانًا أن تساعد التجزئة الصرفية المسبقة، لكنها ليست أفضل دائمًا؛ يعتمد الأمر على النموذج والبيانات والمهمة.

قدمت ورقة آرابيرت عام ٢٠٢٠ نموذجًا مبنيًّا على بنية بيرت ومدربًا خصيصًا للعربية، وأظهرت في وقتها تحسنًا قويًّا في عدة مهام لفهم العربية مقارنة بخطوط أساس مستخدمة آنذاك. القيمة المنهجية الأهم هنا هي أن اللغة المستهدفة وطريقة إعداد بيانات ما قبل التدريب والتقطيع تؤثر في الأداء، ولا يكفي اختيار نموذج مشهور دون تحليل ملاءمته للعربية ولهجاتها.

في تقييم الترجمة استخدم مقاييس آلية للمقارنة السريعة، لكن لا تعتبرها حكمًا نهائيًّا. افحص حفظ المعنى والطلاقة والمصطلحات والأسماء والاتساق، واستعن بتقييم بشري عند القرارات المهمة. في اللهجات، أضف سؤالًا عن ملاءمة الصياغة اجتماعيًّا وسياقيًّا، لا عن التطابق مع مرجع واحد فقط.


استرجاع المعلومات العربية

يهدف استرجاع المعلومات إلى ترتيب الوثائق الأكثر صلة باستعلام المستخدم. تبدأ الأنظمة التقليدية بفهرسة الكلمات أو الجذوع أو اللمم، بينما تستعمل الأنظمة الحديثة أيضًا تمثيلات كثيفة مبنية على الشبكات العصبية. في العربية يؤثر التطبيع واللواصق والتشكيل والمرادفات واللهجات مباشرة في المطابقة.

مثلًا، قد يبحث المستخدم بصيغة «بالجامعات» بينما تحتوي الوثيقة على «جامعة». يمكن للتجزئة أو الإرجاع إلى اللمّة أو التوسع الاستعلامي أن يزيد الاستدعاء، لكنه قد يخفض الدقة إذا دمج أشكالًا غير متكافئة. لذلك صمم المعالجة بحسب هدف الاسترجاع ومجاله.

مجموعة ميراكل مرجع مهم للاسترجاع متعدد اللغات؛ ويضم قسم العربية أكثر من مليوني مقطع مستخرج من مئات الآلاف من مقالات ويكيبيديا العربية، مع استعلامات وأحكام صلة بشرية للتدريب والتطوير والاختبار. فائدتها أنها تسمح بتقييم أنظمة استرجاع عربية في إطار متعدد اللغات، لكن ويكيبيديا ليست ممثلة لكل أنواع البحث العربي.

المحاضرتان العربيتان الآتيتان تقدمان مدخلًا جامعيًّا إلى الاسترجاع، ثم الفهرسة والمعالجة الأولية:

مثال تجريبي بسيط على استرجاع وثائق عربية بتمثيل تكرار المصطلح ووزنه:

from sklearn.feature_extraction.text import TfidfVectorizer
from sklearn.metrics.pairwise import cosine_similarity

الوثائق = [
    "تعالج اللسانيات الحاسوبية النصوص واللغة",
    "تستخدم أنظمة الكلام نماذج صوتية ولغوية",
    "يحتاج البحث العربي إلى فهرسة وتطبيع مناسبين"
]
الاستعلام = ["استرجاع النص العربي"]

المحوّل = TfidfVectorizer(analyzer="char_wb", ngram_range=(3, 5))
مصفوفة = المحوّل.fit_transform(الوثائق + الاستعلام)
الدرجات = cosine_similarity(مصفوفة[-1], مصفوفة[:-1])[0]
print(الدرجات)

هذا المثال يوضح المبدأ ولا يمثل نظام استرجاع إنتاجيًّا. في مشروع متقدم قارن بين أساس معجمي ونموذج كثيف، وثبّت مجموعة الاختبار، وأبلغ عن الدقة والاستدعاء وجودة الترتيب، ثم افحص الاستعلامات التي يفشل فيها كل نموذج.


الموارد العربية وتصميم التجربة

المورد المهمة الأساسية ما الذي يجب الانتباه إليه
تشكيلة التشكيل والتحليل النصي يغلب عليها النص المشكول الكلاسيكي وبعض الحديث، لذلك افحص ملاءمة المجال
مادار اللهجات والترجمة وتحديد اللهجة تغطية مدينية غنية لكنها في مجال السفر وليست عينة من كل الاستخدام اليومي
قادي تحديد اللهجة على مستوى البلد مصدر اجتماعي وتسميات بلد، مع تحديات الخصوصية واستمرار توافر المنشورات
كومن فويس التعرف على الكلام بيانات مجتمعية؛ افحص توازن المتحدثين واللهجات وجودة التسجيل
إم جي بي اثنان التعرف على كلام البث متعدد اللهجات بيانات بث وليست محادثة يومية شاملة
ميراكل استرجاع المعلومات مبني على ويكيبيديا، وقد يختلف عن بحث الويب أو التجارة أو الأخبار


تقسيم البيانات ومنع التسرب

قسّم البيانات إلى تدريب وتطوير واختبار قبل الضبط النهائي. في بيانات اللهجات أو الشبكات الاجتماعية، لا يكفي التقسيم العشوائي للسطر إذا كان الكاتب نفسه يظهر في أكثر من قسم؛ فقد يتعلم النموذج أسلوب الكاتب بدل اللهجة. وفي الكلام، افصل المتحدثين بين التدريب والاختبار عندما يكون هدفك قياس التعميم على متحدثين جدد. وفي الاسترجاع، احذر من وجود الوثيقة نفسها أو نسخة شبه مطابقة منها في التدريب والاختبار.

أبلغ عن المقاييس المناسبة للمهمة: الدقة والاستدعاء والدرجة التوافقية للتصنيف، ومعدل خطأ الكلمات للكلام، ومقاييس الترتيب للاسترجاع، ومقاييس آلية مع تقييم بشري للترجمة. إذا كانت الفئات غير متوازنة، فالمتوسط الكلي وحده قد يكون مضللًا؛ استخدم أيضًا متوسطًا يعطي كل فئة وزنًا متساويًا، واعرض الأداء حسب اللهجة أو المجال.


الإنصاف والأخلاقيات

اللغة مؤشر اجتماعي، وقد تكشف اللهجة عن منطقة أو جماعة أو هوية. لا تستخدم بيانات شخصية دون أساس قانوني وأخلاقي مناسب، ولا تنشر نصوصًا خاصة في تقارير التجارب. تجنب وصف لهجة بأنها «أقل صحة» لأن النموذج يخطئ فيها؛ الخطأ غالبًا يعكس نقص البيانات أو اختلاف المجال. يجب أن يكون هدف التقييم كشف فجوات الخدمة لا تحويلها إلى أحكام على المتحدثين.

افحص أيضًا التحيزات في النماذج التوليدية والترجمة والتصنيف. قد تربط النماذج لهجات معينة بموضوعات أو مشاعر سلبية بسبب تحيز المصدر. أضف مجموعات اختبار مضادة، وراجع الأخطاء مع متحدثين أو باحثين يعرفون اللهجة، ووثّق حدود النظام بوضوح.


قراءات وأبحاث مختارة

  1. ورقة حزمة كامِل تولز لمعالجة العربية: تعرض أدوات مفتوحة المصدر للمعالجة الأولية والصرف وتحديد اللهجة والتعرف على الكيانات وتحليل المشاعر.
  2. ورقة مدونة مادار ومعجمها: تشرح بناء موارد موازية تغطي لهجات خمس وعشرين مدينة عربية.
  3. ورقة نموذج آرابيرت: تعرض تدريب نموذج بيرت مخصص للعربية وتقييمه على مهام فهم لغوي متعددة.
  4. ورقة مدونة تشكيلة: تشرح موردًا واسعًا للنصوص العربية المشكلة واستخداماته في التشكيل الآلي.
  5. ورقة مجموعة قادي لتحديد اللهجات: تناقش جمع بيانات لتصنيف اللهجة على مستوى البلد وتحليل جودتها.
  6. ورقة ميراكل للاسترجاع متعدد اللغات: تقدم مجموعة استرجاع واسعة تشمل العربية مع أحكام صلة بشرية.
  7. ورقة تحدي إم جي بي اثنان للكلام العربي: تعرض بيانات بث عربية متعددة الأنماط واللهجات لتقييم التعرف على الكلام.
  8. مرصد حوسبة العربية: مرجع عربي حديث لتتبع الأدوات والموارد والنماذج والتحديات في حوسبة العربية.


مهام تفاعلية


اختبار: اختبر معرفتك

ما السبب الرئيس في أن التقطيع بالمسافات وحده لا يكفي دائمًا للعربية؟ (لأن اللواصق قد تتصل بالكلمة) (!لأن العربية لا تستخدم المسافات) (!لأن كل الكلمات العربية من ثلاثة أحرف) (!لأن علامات الترقيم ممنوعة في العربية)




ما الخطر المحتمل من توحيد أشكال الألف في كل المهام؟ (قد يزيل معلومة إملائية مفيدة) (!يمنع تخزين النص في يونيكود) (!يحول النص تلقائيا إلى صوت) (!يجعل كل الكلمات متساوية في الطول)




ما الفرق الجوهري بين التحليل الصرفي وإزالة الغموض الصرفي؟ (التحليل يولد احتمالات وإزالة الغموض تختار الأنسب سياقيا) (!التحليل للصوت وإزالة الغموض للصور) (!التحليل للترجمة وإزالة الغموض للتخزين) (!لا يوجد فرق بين العمليتين)




لماذا يفيد مورد مادار في دراسة التنوع اللهجي؟ (لأنه يقارن تعبيرات موازية بين لهجات مدن متعددة) (!لأنه يقتصر على العربية الفصحى المشكولة) (!لأنه يحتوي على صور أقمار صناعية فقط) (!لأنه يلغي الفروق بين اللهجات)




ما الذي ينبغي فعله عند تقييم مصنف لهجات على بيانات غير متوازنة؟ (عرض الأداء لكل فئة إلى جانب المتوسط) (!الاكتفاء بعدد أمثلة التدريب) (!حذف اللهجات قليلة التمثيل) (!اختبار النموذج على بيانات التدريب فقط)




ما المهمة الأساسية لنظام التعرف الآلي على الكلام؟ (تحويل الإشارة الكلامية إلى نص) (!تحويل النص إلى خريطة جغرافية) (!ترتيب نتائج البحث فقط) (!استخراج جذور الكلمات دون صوت)




لماذا لا يكفي معدل خطأ الكلمات وحده لتقييم نظام كلام؟ (لأن أهمية الأخطاء تختلف حسب الكلمة واللهجة والمجال) (!لأنه لا يمكن حسابه على النص) (!لأنه يقيس سرعة المعالج فقط) (!لأنه يساوي دائما صفرا)




ما فائدة مجموعة ميراكل في هذا المقرر؟ (تقييم استرجاع المعلومات العربية ضمن إطار متعدد اللغات) (!توليد أصوات بشرية من الصور) (!استبدال كل مجموعات اللهجات) (!تعليم كتابة الخط اليدوي فقط)




ما الإجراء الأفضل لتقليل تسرب الكاتب في تجربة تحديد اللهجة؟ (فصل كتاب التدريب عن كتاب الاختبار) (!نسخ منشورات الكاتب إلى كل الأقسام) (!حذف التسميات من مجموعة الاختبار) (!قياس الأداء على التدريب فقط)




ما المبدأ الأخلاقي الأنسب عند مقارنة أداء النموذج على اللهجات؟ (تفسير الفروق بوصفها فجوات بيانات ونظام لا أحكاما على المتحدثين) (!وصف اللهجة الأقل أداء بأنها أقل صحة) (!إخفاء نتائج اللهجات قليلة التمثيل) (!استخدام النصوص الخاصة دون إذن)





لعبة الذاكرة

التقطيع تقسيم النص إلى وحدات قابلة للمعالجة
التطبيع توحيد تمثيلات كتابية مختارة بحسب المهمة
اللمّة الصيغة المعجمية التي ترد إليها الأشكال المصرفة
التشكيل إضافة الحركات المناسبة إلى النص العربي
اللهجة نمط لغوي محلي أو اجتماعي ذو خصائص مميزة
الاسترجاع ترتيب الوثائق بحسب صلتها باستعلام
التفريغ تحويل الكلام المسجل إلى نص مكتوب





السحب والإفلات

صِل كل مصطلح بوصفه الصحيح معالجة اللغة العربية بالحاسوب
مادار مدونة موازية للهجات مدن عربية متعددة
تشكيلة مدونة واسعة من النصوص العربية المشكلة
قادي بيانات لتحديد اللهجة على مستوى البلد
كومن فويس تسجيلات كلام مجتمعية تشمل العربية
ميراكل مجموعة لتقييم استرجاع المعلومات متعدد اللغات
آرابيرت نموذج لغوي مدرب خصيصا للعربية
كامِل تولز حزمة برمجية مفتوحة لمعالجة العربية





كلمات متقاطعة

التقطيع ما اسم عملية تقسيم النص إلى وحدات؟
الصرف ما المستوى اللغوي الذي يدرس بنية الكلمة وتغير صيغها؟
اللهجات ما الأنماط المحلية والاجتماعية المتنوعة للعربية؟
التشكيل ما عملية إضافة الحركات إلى النص؟
الترجمة ما المهمة التي تحول معنى النص من لغة إلى أخرى؟
الاسترجاع ما العملية التي ترتب الوثائق بحسب صلتها بالاستعلام؟





مهام مفتوحة


سهل

  1. تجربة تطبيع: اختر عشر جمل عربية من مصدر مفتوح، وطبّق عليها قاعدتين مختلفتين للتطبيع، ثم اكتب فقرة تشرح معلومة كسبتها ومعلومة ربما فقدتها.
  2. مقارنة مقطعات: قارن يدويًّا بين التقطيع بالمسافات وتقطيع أداة برمجية لعشرين جملة تتضمن لواصق وعلامات ترقيم، وسجل أنواع الاختلاف.
  3. خريطة صرفية: أنشئ مخططًا عربيًّا يربط الجذر والوزن واللمّة واللواصق والتشكيل بمثال واحد من اختيارك.
  4. ملاحظة لهجية: اجمع أمثلة منشورة علنًا وآمنة من ثلاث لهجات عربية، وصنّف الظواهر إلى مفردات وإملاء ولواصق دون جمع بيانات شخصية.


متوسط

  1. مصنف لهجات صغير: ابن نموذجًا تعليميًّا لتصنيف مجموعة عربية مفتوحة، وقارن بين سمات الكلمات وسمات المحارف، ثم حلل خمسة أخطاء على الأقل.
  2. تقييم تشكيل: خذ عينة مشكلة من مورد مفتوح، واحذف الحركات ثم اختبر أداة تشكيل متاحة، واحسب الأخطاء وناقش أثر حركات أواخر الكلمات.
  3. مختبر استرجاع: ابن فهرسًا صغيرًا لوثائق عربية، وقارن نتائج البحث قبل التطبيع وبعده لخمسة استعلامات، وفسر حالات تحسن الاستدعاء أو تراجع الدقة.
  4. تحليل تفريغ صوتي: استخدم تسجيلات عربية مرخصة ومجهولة الهوية، وقارن تفريغ نظام كلام على فصحى ولهجة واحدة، ثم صنّف الأخطاء إلى صوتية ومعجمية ولهجية.


متقدم

  1. دراسة لهجات مدينية: صمم تجربة على بيانات مادار تقيس انتقال نموذج من مجموعة مدن إلى مدن غير مرئية، وناقش ما إذا كانت الفئات الجغرافية تمثل الواقع اللغوي بدقة.
  2. نظام استرجاع عربي: قارن على قسم عربي من ميراكل بين خط أساس معجمي ونموذج استرجاع كثيف، وأبلغ عن مقاييس الترتيب مع تحليل استعلامات النجاح والفشل.
  3. تدقيق إنصاف: أنشئ بروتوكول تقييم يقيس أداء نموذج عربي عبر لهجات ومجالات مختلفة، وحدد أين تظهر فجوات البيانات وكيف ستبلغ عنها دون وصم المتحدثين.
  4. ورقة مصغرة: صغ سؤال بحث، واختر مجموعة بيانات مناسبة، وابن خط أساس، ونفذ تجربة قابلة لإعادة الإنتاج، ثم قدم النتائج في تقرير أو عرض أو فيديو أكاديمي مع قسم للقيود والأخلاقيات.





مجالات تعلم مرتبطة


مسرد

المصطلح التعريف
التقطيع تقسيم النص إلى كلمات أو وحدات أصغر يمكن للنموذج معالجتها.
التجزئة الصرفية فصل اللواصق والمكونات الصرفية داخل الشكل الكتابي للكلمة.
التطبيع تحويل تمثيلات كتابية مختارة إلى صورة موحدة وفق هدف محدد.
اللمّة الصيغة المعجمية التي تجمع تحتها أشكالًا صرفية متعددة.
إزالة الغموض اختيار التحليل الأنسب من عدة تحليلات ممكنة باستخدام السياق.
التشكيل الآلي التنبؤ بالحركات المناسبة لنص عربي غير مشكول أو ناقص التشكيل.
تحديد اللهجة استنتاج النمط اللهجي أو الفئة الجغرافية التقريبية من نص أو كلام.
التعرف على الكلام تحويل الإشارة الكلامية إلى نص مكتوب.
الترجمة الآلية إنتاج نص بلغة هدف يحافظ قدر الإمكان على معنى نص المصدر.
استرجاع المعلومات ترتيب وثائق أو مقاطع وفق صلتها باستعلام المستخدم.
تسرب البيانات انتقال معلومات من الاختبار إلى التدريب بطريقة تجعل التقييم متفائلًا بصورة غير واقعية.
تحليل الأخطاء فحص منهجي لأنواع الفشل لفهم حدود النموذج وطرق تحسينه.


مشروعات aiMOOC

MOOCwiki · Deutsch

Nach dem Lernen ist vor dem Lernen

Entdecke direkt den nächsten Lernkurs. Weitere Inhalte erscheinen, wenn Du weiter nach unten scrollst.

Zur MOOCwiki-Hauptseite

Mediathek

Mediathek

Inhalte werden geladen ...

Mediathek wird aus dem Wiki geladen ...