إنفيديا علمت نموذجها النجدية والحجازية من بيانات صدى: الأخطاء من 55 إلى 30 كلمة في كل 100

إنفيديا علمت نموذجها النجدية والحجازية من بيانات صدى: الأخطاء من 55 إلى 30 كلمة في كل 100
نشرت وكالة الأنباء السعودية اليوم، السبت 3 أكتوبر 2026، أن شركة إنفيديا اعتمدت على مجموعة البيانات الصوتية السعودية صدى، التي أطلقتها الهيئة السعودية للبيانات والذكاء الاصطناعي (سدايا) بالتعاون مع هيئة الإذاعة والتلفزيون، لتدريب نموذجها للتعرف الآلي على الكلام Nemotron 3.5 ASR. والنتيجة بحسب الدراسة التي نشرتها إنفيديا في مدونة المطورين يوم 30 سبتمبر: نموذج كان يخطئ في نحو 55 كلمة من كل 100 باللهجتين النجدية والحجازية، صار يخطئ في نحو 30.
الخبر يهم كل منشأة لديها أرشيف مكالمات مع عملائها، أو خط خدمة عملاء، أو اجتماعات تسجلها. لكن الرقم وحده لا يكفي لاتخاذ قرار. هذا المقال يشرح ما الذي تصلح له دقة كهذه وما الذي لا تصلح له، والشرط الذي لا يظهر في الخبر عن ترخيص البيانات، وأين يجب أن يعالج صوت عملائك.
ما الذي حدث بالأرقام
- النموذج: Nemotron 3.5 ASR، نموذج تفريغ لحظي بحجم 600 مليون معامل، يدعم 40 لغة بصيغها الإقليمية، 32 منها تفرغ مباشرة دون تدريب إضافي، والعربية فيه ضمن فئة اللغات الجاهزة للتفريغ. وتنص صفحته في منصة Hugging Face على أنه جاهز للاستخدام التجاري، وترخيصه OpenMDW-1.1.
- البيانات: 133.7 ساعة من الكلام النجدي والحجازي من صدى. وخلطها فريق إنفيديا بنسبة 90% كلام سعودي و10% من بيانات FLEURS العامة (7% إنجليزي و3% عربي)، حتى لا ينسى النموذج ما كان يجيده قبل التدريب.
- معدل الخطأ في الكلمات على النجدية والحجازية: من 55.05% إلى 29.96%. وعلى كامل بيانات صدى بمختلف لهجاتها: من 58.84% إلى 35.61%.
- معدل الخطأ في الحروف على النجدية والحجازية: من 31.63% إلى 12.18%.
- لم يتراجع في الاختبارين اللذين أجرتهما إنفيديا: تحسن قليلا في الإنجليزية (من 11.04% إلى 10.42%) وفي اختبار العربية من FLEURS (من 12.67% إلى 11.41%).
- كلفة التدريب: 12 ألف خطوة في نحو أربع ساعات ونصف على وحدتي معالجة رسومية من فئة محطات العمل RTX PRO 6000 Blackwell.
- السرعة: يعمل النموذج بزمن استجابة يبدأ من 80 جزءا من الثانية، وتعرض صفحته خمسة إعدادات للتفريغ اللحظي من 80 إلى 1120 جزءا من الثانية. لكن معدلات الخطأ أعلاه قيست على الإعداد الافتراضي 320 جزءا من الثانية، والدقة تتحسن كلما كبر المقطع، فالإعداد الأسرع يقايض شيئا من الدقة بالسرعة.
أما صدى نفسها، فبحسب الوكالة تضم نحو 667 ساعة صوتية مع تفريغها النصي، أغلبها باللهجات السعودية، وتغطي أكثر من عشر لهجات في أكثر من 125 ألف مقطع مصنف حسب لهجة المتحدث، ونشرتها سدايا على منصة Kaggle للباحثين والمطورين.
30 كلمة خطأ من كل 100: ما الذي تصلح له وما الذي لا تصلح له
معدل الخطأ في الكلمات يعد كل كلمة استبدلت أو سقطت أو أضيفت. فإن كان 30%، فنص مكالمة من 100 كلمة قد يحمل نحو 30 خطأ. هذا تحسن كبير عن 55، لكنه لا يجعل النص سجلا حرفيا يعتمد عليه.
والفرق بين معدل الكلمات (نحو 30%) ومعدل الحروف (نحو 12%) له معنى عملي: الكلمة التي أخطأ النموذج في حرف واحد منها تحسب كلمة خاطئة كاملة، فجزء من الأخطاء حرف أو حرفان داخل الكلمة، لا كلمة ضائعة كلها. ولهذا قد يكون النص المفرغ أنفع للبحث والتصنيف مما يوحي به رقم 30%، بشرط أن يتسامح البحث مع الأخطاء الإملائية القريبة ولا يشترط التطابق التام.
- يصلح له: البحث في أرشيف المكالمات عن اسم منتج أو شكوى متكررة، وتصنيف المكالمات حسب سببها، وملخص يراجعه موظف، واختيار عينة مكالمات لمراجعة الجودة بدل الاستماع العشوائي.
- لا يصلح له وحده: محضر يعتمد عليه في نزاع، أو تنفيذ أمر مالي من نص المكالمة دون مراجعة، أو رد آلي يأخذ كلام العميل حرفيا ثم يتصرف.
وانتبه إلى أن صدى مصدرها برامج ومسلسلات تلفزيونية: أكثر من 600 ساعة من أكثر من 57 برنامجا ومسلسلا قدمتها هيئة الإذاعة والتلفزيون. أما مكالمة عميلك فصوت عبر الهاتف، قد يأتي من سيارة أو محل مزدحم، وقد يتداخل فيه متحدثان. وإنفيديا نفسها كتبت في دراستها أن هذا المسار لا يصلح دليلا على كل لهجة عربية أو كل بيئة تشغيل. فالرقم الذي يهمك هو الرقم على مكالماتك أنت.
الشرط الذي لا يظهر في الخبر: ترخيص صدى غير تجاري
النموذج الأساسي مرخص للاستخدام التجاري. لكن مجموعة بيانات صدى منشورة على Kaggle بترخيص المشاع الإبداعي CC BY-NC-SA 4.0، أي نسب العمل لصاحبه، وعدم الاستخدام التجاري، والمشاركة بالترخيص نفسه. فإن أردت أن تدرب نموذجا لمنشأتك على صدى، فراجع شروط الترخيص أو اطلب إذن صاحب البيانات أولا، ولا تفترض أن إتاحتها للباحثين تعني إتاحتها لمنتجك.
وإنفيديا نشرت خطوات التجربة وشيفرتها في الدراسة نفسها، وأحالت إلى دفتر تدريب عام بياناته التجريبية إنجليزية لا من صدى، ولم تذكر أنها نشرت نسخة النموذج بعد تدريبه على صدى. فالمتاح لك اليوم هو النموذج الأساسي والطريقة. أما البيانات التي تملك حق استخدامها في عملك، فهي في الغالب تسجيلات منشأتك نفسها.
مكالماتك هي البيانات: ماذا تجهز قبل أي تجربة
- عينة حقيقية: اختر مكالمات من خطك الفعلي، بلهجات عملائك، وبالجودة التي يسجل بها نظامك، ومنها مكالمات صعبة فيها ضوضاء وحديث متداخل وأرقام وأسماء منتجات.
- نص مرجعي: يفرغها موظف يدويا مرة واحدة. هذا النص هو المسطرة التي تقيس عليها أي نموذج وأي مزود، لا العرض التجريبي الذي يقدمه البائع.
- قس ما يهمك: هل التقط النموذج رقم الطلب واسم المنتج وسبب الاتصال؟ هذه الحقول أهم لعملك من نسبة الخطأ العامة.
- الإشعار والغرض: نظام حماية البيانات الشخصية يعرف البيانات الشخصية بأنها أي بيانات، أيا كان مصدرها أو شكلها، تؤدي إلى معرفة الفرد، ومنها أرقام التواصل. ويعد التسجيل والحفظ والاستخدام والنقل من صور المعالجة. فمكالمة العميل المسجلة تحمل في الغالب بيانات شخصية، وتفريغها معالجة لها. تأكد أن لديك أساسا نظاميا لكل غرض، وأن إشعار الخصوصية الذي يسمعه عميلك أو يقرؤه يغطي التفريغ والتحليل، خصوصا إن نويت استخدام التسجيلات في تدريب نموذج. وقد فصلنا ذلك في مقالة محادثات العملاء ونظام حماية البيانات الشخصية.
أين يعالج صوت عملائك
هنا يظهر فرق عملي بين طريقين:
- نموذج مفتوح على خادمك أو في سحابة داخل المملكة: الصوت لا يغادر المملكة، وأنت من يحدد مدة الاحتفاظ ومن يطلع. لكنه يعمل أفضل على خادم بمعالج رسومي من إنفيديا، فصفحة النموذج تذكر معماريات إنفيديا من Volta إلى Blackwell ونظام لينكس، وتشير كذلك إلى أداة تشغيل محلية خفيفة من إنفيديا اسمها NeMo-Speech.cpp يمكنها تشغيله على المعالج العادي. أما تدريبه على مكالماتك فيحتاج معالجات رسومية، ويحتاج النموذج في الحالتين من يشغله ويحدثه. وقد شرحنا حسابات العتاد في مقالة تشغيل النماذج على خوادمك.
- خدمة تفريغ سحابية خارج المملكة: أسهل في البدء، لكن تسجيلات عملائك تنقل إلى الخارج، ونقل البيانات الشخصية خارج المملكة تحكمه لائحة نقل البيانات الشخصية خارج المملكة، وهي من اللوائح التنفيذية لنظام حماية البيانات الشخصية. فاسأل مزودك أين يعالج الصوت وأين يخزن قبل أن تسأله عن السعر.
أسئلة لمزود مركز الاتصال أو الرد الآلي
إن كان لديك مزود لمركز الاتصال، أو تفكر في وكيل صوتي يرد على عملائك، فهذه أسئلة تكشف الكثير في اجتماع واحد:
- ما اللهجات التي يدعمها نظامكم فعلا، وعلى أي بيانات قستم دقته؟
- هل تقبلون قياس الدقة على عينة من مكالماتنا بنص مرجعي نفرغه نحن؟
- أين يعالج الصوت وأين يخزن النص، داخل المملكة أم خارجها؟
- هل تستخدمون تسجيلاتنا لتدريب نماذجكم، وكيف نوقف ذلك؟
- كم تحتفظون بالتسجيلات والنصوص، وهل نستطيع تصديرها وحذفها؟
نظرة أوريجامي
الصوت أكثر بيانات المنشأة السعودية ضياعا. مكالمة فيها شكوى أو طلب أو وعد من موظف تنتهي، ثم لا يبحث فيها أحد ولا ترتبط بسجل العميل. وما حدث مع صدى يوضح أن الفجوة بين النماذج العالمية ولهجاتنا تضيق ببيانات سعودية جيدة التصنيف، حتى مع نموذج صغير بحجم 600 مليون معامل.
ونقرأ الخبر لصاحب المنشأة هكذا: لا تبدأ بموظف آلي يرد على العملاء. ابدأ بأرشيف يمكن البحث فيه، وتصنيف يربط كل مكالمة بسببها وبسجل العميل في نظامك، وموظف يراجع. ثم قس الدقة على مكالماتك أنت قبل أي توسع. والقرار الأول ليس أي نموذج تختار، بل أين يعالج صوت عملائك ومن يملكه.
الخلاصة
- إنفيديا خفضت أخطاء نموذجها في النجدية والحجازية من نحو 55 إلى نحو 30 كلمة في كل 100، بتدريب على 133.7 ساعة من بيانات صدى.
- خطأ بنسبة 30% يكفي للبحث والتصنيف والملخصات مع مراجعة بشرية، ولا يكفي لسجل حرفي أو قرار آلي.
- النموذج الأساسي مرخص تجاريا، لكن صدى مرخصة لغير الاستخدام التجاري، فراجع الترخيص قبل أن تبني عليها.
- قس أي نموذج أو مزود على عينة من مكالماتك بنص مرجعي تفرغه بنفسك.
- اعرف أين يعالج الصوت، وتأكد أن إشعار الخصوصية يغطي التفريغ والتحليل.
مصادر
- وكالة الأنباء السعودية: إنفيديا العالمية تستعين باللهجات السعودية في مشروعها Nemotron 3.5 ASR (3 أكتوبر 2026)
- مدونة إنفيديا للمطورين: Fine-Tuning NVIDIA Nemotron for Saudi Arabic Dialects (30 سبتمبر 2026)، ومنها جداول معدلات الخطأ وتفاصيل التدريب
- صفحة النموذج في Hugging Face: الحجم والترخيص واللغات والعتاد
- مجموعة بيانات صدى على Kaggle: الوصف والترخيص CC BY-NC-SA 4.0
- سدايا: دليل نظام حماية البيانات الشخصية للجهات المتحكمة والمعالجة، ومنه تعريف البيانات الشخصية والمعالجة في المادة الأولى، وذكر لائحة نقل البيانات الشخصية خارج المملكة
أسئلة شائعة
هل أستطيع استخدام نموذج إنفيديا المدرب على صدى في منشأتي اليوم؟+
الدراسة نشرت طريقة التدريب وشيفرتها مع إحالة إلى دفتر تدريب عام، ولم تذكر أنها نشرت النسخة المدربة على صدى. المتاح هو النموذج الأساسي Nemotron 3.5 ASR، وصفحته تنص على أنه جاهز للاستخدام التجاري، ويمكن تدريبه بالطريقة نفسها على بيانات تملك حق استخدامها. أما صدى فترخيصها CC BY-NC-SA 4.0 غير تجاري، فراجعه قبل أن تبني عليها منتجا.
ماذا يعني معدل خطأ 30% في الكلمات عمليا؟+
يعني نحو 30 كلمة مستبدلة أو ساقطة أو زائدة في كل 100 كلمة. نص بهذه الدقة يصلح للبحث في أرشيف المكالمات وتصنيفها وتلخيصها مع مراجعة موظف، ولا يصلح وحده محضرا حرفيا أو أساسا لقرار آلي. ومعدل الخطأ في الحروف كان نحو 12%، فجزء من الأخطاء حرف أو حرفان داخل الكلمة.
عملائي من مناطق أخرى غير نجد والحجاز، فهل تنطبق هذه النتائج عليهم؟+
التدريب استهدف النجدية والحجازية، وعلى كامل بيانات صدى بلهجاتها المتعددة انخفض الخطأ إلى 35.61% لا إلى 30%. وإنفيديا نفسها كتبت أن النتيجة ليست دليلا على كل لهجة عربية أو كل بيئة تشغيل. الطريقة الوحيدة لتعرف هي أن تقيس على عينة من مكالمات عملائك.
هل تسجيل مكالمات العملاء وتفريغها يخضع لنظام حماية البيانات الشخصية؟+
في الغالب نعم، لأن المكالمة تحمل عادة رقم العميل أو اسمه أو تفاصيل طلبه، والنظام يعرف البيانات الشخصية بأنها أي بيانات تؤدي إلى معرفة الفرد أيا كان شكلها، ويعد التسجيل والحفظ والاستخدام والنقل معالجة. فتأكد أن لديك أساسا نظاميا لكل غرض وأن إشعار الخصوصية يغطي التفريغ والتحليل، وانتبه إلى أن إرسال التسجيلات إلى خدمة خارج المملكة تحكمه لائحة نقل البيانات الشخصية خارج المملكة.
تابع أوريجامي في نتائج قوقل
ثبت أوريجامي كمصدر مفضل، فتظهر لك مقالاتنا أولا في نتائج قوقل وفي الأخبار الرائجة.
الإضافة إلى المصادر المفضلة في Googleمقالات ذات صلة
- الذكاء الاصطناعيجوجل تسلم Gemini 4 Argon لمدافعي الأمن السيبراني أولا: مليون رمز في الإجابة الواحدةGemini 4 Argon من جوجل يكتشف الثغرات ويرقعها وحده ويكتب حتى مليون رمز بسعر افتتاحي 2 و10 دولارات للمليون. من يحصل عليه أولا، وكيف تستعد منشأتك؟
- الذكاء الاصطناعيمتجر Claude يضع أكثر من 2000 موصل على بعد نقرة من بيانات شركتكأطلقت أنثروبيك متجر Claude Marketplace بأكثر من 2000 موصل وإضافة ووكلاء جاهزة. ما الذي تتحقق منه قبل ربط Claude بأنظمتك، ومتى تبني موصلك الخاص.
- الذكاء الاصطناعيوكلاء Dots من OpenAI يعملون وأنت نائم: ماذا يفعلون دون إذنك؟أطلقت OpenAI وكلاء Dots الدائمة بحاسوب سحابي خاص وربط بأكثر من 4000 تطبيق. ما الذي يفعله الوكيل وحده، وما الذي يستأذنك فيه، وكيف تضبطه قبل تشغيله في شركتك.
- الذكاء الاصطناعيEleven v4 يرد بالعربية خلال 100 ملي ثانية، والصعب هو ما سيقوله لعميلكأطلقت إليفن لابز Eleven v4 ونسخة Turbo بزمن توليد نحو 100 ملي ثانية ودعم أكثر من 90 لغة منها العربية. الأسعار والحدود وما تجهزه قبل أن يرد صوت آلي على عملائك.
- الذكاء الاصطناعيشاومي تفتح MiMo-V2.6 برخصة MIT، ونسخته الخفيفة تقرأ مليون رمز بـ14 سنتاأطلقت شاومي نماذج MiMo-V2.6 مفتوحة المصدر برخصة MIT: نموذج واحد يفهم النص والصوت والصورة والفيديو بسياق مليون رمز وأسعار تبدأ من 0.14 دولار للمليون.
- الذكاء الاصطناعيوكيل مفتوح المصدر يعمل لأيام لا لدقائق: Atria Dawn وفاتورة تشغيله الحقيقيةمختبر شنغهاي نشر Atria Dawn بترخيص MIT: 744 مليار معامل لوكيل مصمم للمهام الطويلة. ما الذي يصلح له فعلا، وكم يكلّف تشغيله داخل منشأتك.
عندك مشروع تفكر فيه؟
نبني أنظمة وتطبيقات ومواقع مخصصة لأعمالك. احك لنا عن فكرتك ونعطيك رأينا الصريح فيها.
