العودة للمدونة
الذكاء الاصطناعي

SWE-2 يطابق نماذج الصف الأول في البرمجة بثلث التكلفة، ثم يسقط في اختبار واحد

فريق أوريجاميفريق التحرير
8 دقائق
SWE-2 يطابق نماذج الصف الأول في البرمجة بثلث التكلفة، ثم يسقط في اختبار واحد
يعجبك ما ننشره؟ ثبت أوريجامي كمصدر مفضل في قوقل.الإضافة إلى المصادر المفضلة في Google

نموذج برمجة جديد يقترب من القمة بتكلفة أقل بكثير، وفيه ثغرة واحدة واضحة

في العاشر من سبتمبر 2026 أطلقت شركة Cognition، صاحبة وكيل البرمجة Devin، نموذجا جديدا اسمه SWE-2. الخبر المهم في سطر واحد: النموذج سجل 50.0% في اختبار FrontierCode 1.1 الأساسي، مقابل 50.9% لنموذج Fable 5.1 من Anthropic، أي فارق أقل من نقطة واحدة، وتقول Cognition إن تشغيله يكلف أقل بنسبة 64% للوصول إلى النتيجة نفسها. لكن القصة لا تنتهي هنا: في اختبار Terminal-Bench 4 سجل SWE-2 نسبة 27.3% فقط، مقابل 55.8% لـ Fable 5.1 و57.9% لـ GPT-6 Astra. فارق يقارب ثلاثين نقطة في عمود واحد.

هذا التناقض هو الدرس الحقيقي للمنشآت، وليس الرقم الرخيص وحده. نحن ندخل مرحلة تتوقف فيها المقارنة بين النماذج عند سؤال «أيها أذكى» وتبدأ عند سؤال أدق: أذكى في أي نوع من العمل، وبأي تكلفة، وأين ينهار.

الأرقام المعلنة كما هي

نشرت Cognition جدول مقارنة مباشرا بين SWE-2 ونموذجه الأساسي ونموذجين من الصف الأول. هذه القراءة الكاملة:

  • FrontierCode 1.1 الأساسي: SWE-2 بنسبة 50.0%، النموذج الأساسي Kimi K3 بنسبة 44.2%، GPT-6 Astra بنسبة 53.3%، Fable 5.1 بنسبة 50.9%.
  • DeepSWE 1.1: SWE-2 بنسبة 73.0%، وهي أعلى من Fable 5.1 عند 67.4% وقريبة من Astra عند 74.1%.
  • Terminal-Bench 2.1: SWE-2 بنسبة 92.8%، وهو الأعلى في الجدول أمام 91.4% لـ Fable 5.1 و89.9% لـ Astra.
  • Terminal-Bench 4: SWE-2 بنسبة 27.3% فقط، مقابل 55.8% و57.9%. هذا هو العمود الذي يخسره بوضوح.

ثلاثة أعمدة من أربعة يقف فيها SWE-2 في مصاف النماذج الأغلى منه أو يتقدم عليها، وعمود واحد يسقط فيه سقوطا حرا. ولاحظ أيضا أن النموذج تفوق على أساسه Kimi K3 في كل عمود، وهو المكسب الذي أضافته Cognition بالتدريب.

كيف بُني: مصدر مفتوح كبير، ثم تدريب متخصص فوقه

SWE-2 ليس نموذجا مبنيا من الصفر. أساسه Kimi K3، النموذج مفتوح الأوزان من Moonshot AI بحجم 2.8 تريليون معامل. ما فعلته Cognition هو تدريب لاحق بالتعلم المعزز موجه لعمل واحد: هندسة البرمجيات الحقيقية داخل مستودعات كود فعلية.

الجزء الهندسي الطريف أن النموذج يأتي بثلاثة مستويات جهد قابلة للاختيار: متوسط وعال وأقصى. ولم تُدرَّب هذه المستويات في ثلاث جلسات منفصلة ولا كثلاثة نماذج متخصصة، بل في جلسة تدريب واحدة عبر عقوبة تكلفة مدمجة في دالة المكافأة: النجاح مطروحا منه تكلفة المحاولة مضروبة في معامل يتغير حسب مستوى الجهد. النتيجة نموذج واحد يعرف متى يقتصد ومتى يتعمق، بدل أن تضطر أنت لإدارة ثلاثة نماذج.

الفرق العملي ملموس: على مستوى الجهد المتوسط يقول الفريق إن النموذج يقلص عدد الخطوات بنسبة 58% والتكلفة بنسبة 81% في المتوسط مقارنة بالإصدار السابق SWE-1.7 على الاختبار نفسه. ومعنى ذلك بلغة المشاريع: أقل لفا ودورانا حول المشكلة قبل الوصول إلى حل.

القيد المهم قبل أن تتحمس: لا أوزان مفتوحة ولا واجهة برمجية

هنا يجب الوضوح. SWE-2 ليس نموذجا تستطيع تحميله على خوادمك، ولا تستطيع استدعاءه من تطبيقك عبر واجهة برمجية مستقلة. هو يعمل داخل منصة Devin فقط: تطبيق سطح المكتب وواجهة الأوامر أولا، مع توسعة إلى الويب وFusion. أي أن اقتصاد التكلفة الذي تتحدث عنه Cognition مرتبط بالاشتراك في منصتها، لا بحرية تشغيل النموذج حيث تريد.

الفرق جوهري لمن يقارن: نموذج مفتوح الأوزان يمنحك سيادة على بياناتك وحرية استضافة داخل المملكة، أما هذا فمنتج مغلق يُشترى كخدمة. إذا كان دافعك للبحث عن البديل الأرخص هو إبقاء الكود داخل بيئتك، فهذا الإعلان لا يحل مشكلتك، وإن كان دافعك تقليص فاتورة أدوات التطوير فقد يحلها.

ما يعنيه هذا لمنشأتك عمليا

ثلاث خلاصات تنفع صاحب عمل يدفع فاتورة تطوير أو يفكر في تبني أدوات ذكاء اصطناعي لفريقه التقني:

  • التخصص صار طريقا مختصرا للمنافسة: شركة أصغر بكثير من مختبرات الصف الأول أخذت نموذجا مفتوحا ودربته على عمل واحد، فصار ينافس في ذلك العمل تحديدا. القياس نفسه ينطبق على مشروعك: نموذج متوسط مضبوط على بياناتك وإجراءاتك يهزم غالبا نموذجا أكبر يعمل بلا سياق.
  • الرقم الواحد في الإعلان لا يكفي: لو نظرت إلى FrontierCode وحده لخرجت بأن SWE-2 بديل كامل. عمود Terminal-Bench 4 يقول العكس في فئة مهام معينة. اسأل دائما: على أي اختبار، وما الذي يقيسه، وأين الفجوة.
  • التكلفة ليست سعر الاستدعاء فقط: تكلفتك الحقيقية هي عدد المحاولات حتى نتيجة صحيحة. نموذج أرخص يدور كثيرا قد يكون أغلى فعليا، وهذا بالضبط ما تحاول عقوبة التكلفة في تدريب SWE-2 معالجته.

كيف نتعامل مع هذه الإعلانات في أوريجامي

نحن لا نربط أنظمة عملائنا بنموذج واحد. نبني طبقة وسيطة تسمح بتبديل النموذج خلف الكواليس، ونقيس على مهام العميل الحقيقية لا على الاختبارات المنشورة: عقود فعلية، فواتير فعلية، محادثات عملاء فعلية. هكذا يصبح إعلان مثل SWE-2 فرصة تُختبر في أسبوع، لا قرارا يعيد بناء نظامك.

الخطوة العملية إذا كان لديك فريق تطوير: خذ ثلاث مهام حقيقية من مستودعك، شغّلها على أداتك الحالية وعلى البديل الأرخص، وقس ثلاثة أرقام فقط — هل نجحت المهمة، كم محاولة احتاجت، كم كلفت. القرار بعد ذلك يصبح بديهيا، وبلا أي اعتماد على جدول إعلان.

المصادر

#SWE-2#نماذج البرمجة#تكلفة الذكاء الاصطناعي#Cognition

أسئلة شائعة

هل SWE-2 بديل كامل عن النماذج الأغلى في البرمجة؟+

ليس في كل المهام. في FrontierCode 1.1 سجل 50.0% مقابل 50.9% لـ Fable 5.1، وتفوق في DeepSWE 1.1 وTerminal-Bench 2.1، لكنه سجل 27.3% فقط في Terminal-Bench 4 مقابل 55.8% و57.9% لمنافسيه. فهو بديل قوي في أنواع عمل محددة، وليس بديلا شاملا.

هل أستطيع تشغيل SWE-2 على خوادم شركتي داخل المملكة؟+

لا. أوزان النموذج غير مفتوحة ولا توجد له واجهة برمجية مستقلة، وهو يعمل داخل منصة Devin من Cognition فقط. إذا كان هدفك إبقاء الكود والبيانات داخل بيئتك، فالمسار الصحيح هو نموذج مفتوح الأوزان يُستضاف عندك، لا هذا المنتج.

ما معنى أن التكلفة أقل بنسبة 64%؟+

المقصود تكلفة الوصول إلى النتيجة نفسها على اختبار FrontierCode مقارنة بـ Fable 5.1، وليس خصما على سعر اشتراك. والسبب الأساسي أن النموذج يحتاج خطوات أقل للوصول إلى حل، حيث يقول الفريق إن مستوى الجهد المتوسط يقلص الخطوات 58% والتكلفة 81% مقارنة بالإصدار السابق.

كيف أختبر أي نموذج برمجة جديد قبل تبنيه؟+

خذ ثلاث مهام حقيقية من مستودع الكود لديك، لا مهام تجريبية، وشغّلها على أداتك الحالية وعلى البديل، ثم قس ثلاثة أرقام: هل أُنجزت المهمة بشكل صحيح، كم محاولة احتاجت، وكم كلفت فعليا. هذا القياس يغنيك عن الاعتماد على جداول الاختبارات المعلنة.

تابع أوريجامي في نتائج قوقل

ثبت أوريجامي كمصدر مفضل، فتظهر لك مقالاتنا أولا في نتائج قوقل وفي الأخبار الرائجة.

الإضافة إلى المصادر المفضلة في Google

مقالات ذات صلة

عندك مشروع تفكر فيه؟

نبني أنظمة وتطبيقات ومواقع مخصصة لأعمالك. احك لنا عن فكرتك ونعطيك رأينا الصريح فيها.

جلسة واحدة. عشرون دقيقة. بلا التزامات.