علي بابا تطلق Qwen3.8-Max بـ2.4 تريليون معامل

بقلم فريق تقني · (آخر تحديث: )· ذكاء اصطناعي
علي بابا تطلق Qwen3.8-Max بـ2.4 تريليون معامل

وعدت علي بابا بفتح أوزان Qwen3.8-Max حين أعلنته يوم 3 أغسطس 2026، وأوفت بعد تسعة أيام. لكن ما نزل ليس ما يعمل خلف الواجهة البرمجية: الأوزان المفتوحة نصّية فقط، بينما qwen3.8-max المستضاف يقبل النص والصور والفيديو. والنموذج 2.4 تريليون معامل لا ينشط منها سوى نحو 95 مليار لكل رمز ببنية خليط خبراء متفرّق، بنافذة سياق مليون رمز يتّسع فيها الدخل إلى 991,808 رمزاً والخرج إلى 131,072. مضت نحو أربعة أسابيع نزلت فيها الأوزان وظهرت قياسات مستقلة واتّضح التسعير الإقليمي، والسؤال الآن: هل يحلّ محلّ نموذجك في الإنتاج، وبأي إقليم وإعدادات؟

ما الذي تغيّر بعد الإعلان: الأوزان نزلت لكنها ليست النموذج نفسه

نزل Qwen3.8-2.4T-A95B يوم 12 أغسطس 2026 وQwen3.8-27B يوم 14 أغسطس على هاغينغ فيس وModelScope. لكن «مفتوح» كلمة واحدة تخفي رخصتين: النسخة الصغيرة الكثيفة بـ27 مليار معامل تحت Apache 2.0، تفهم الصور والفيديو وسياقها الأصلي 262,144 رمزاً. أما الكبرى فتخضع لرخصة مخصّصة باسم Qwen3.8-Max License تشترط إظهار اسم النموذج في واجهة المنتجات فوق 100 مليون مستخدم نشط شهرياً أو 20 مليون دولار إيراداً شهرياً، ورخصة منفصلة لأي نشاط «نموذج كخدمة» فوق 50 مليون دولار خلال 12 شهراً. نصّ الرخصة لا يتضمّن أي قيد جغرافي، خلافاً لما شاع.

وأهمّ من الرخصة فرق تقني: بطاقة الأوزان المفتوحة للنسخة الكبرى تصفها بأنها نصّية فقط، ووضع التفكير فيها إلزامي دائماً. فإن اعتمد مسار عملك على الصور، فالأوزان لا تغني عن الواجهة البرمجية.

بنيةً، النموذج 92 طبقة و512 خبيراً، يُستدعى منها 10 موجَّهين وخبير مشترك واحد لكل رمز، ولم يكن الأكبر حتى وقته إذ يضمّ Kimi K3 من Moonshot الصينية 2.8 تريليون معامل. والاستضافة الذاتية للكبرى غير واقعية لمعظم الفرق؛ تقدير مجتمعي غير رسمي يتحدّث عن نحو 4.8 تيرابايت ذاكرة بدقة BF16، أي 16 إلى 24 مسرّعاً من الفئة العليا. من يريد تشغيلاً محلياً فوجهته Qwen3.8-27B، وليبدأ بحساب متطلبات كرت الشاشة لتشغيل نموذج ذكاء اصطناعي محلياً.

86.6 أم 81.3 أم 67.4؟ ثلاثة أرقام لاختبار واحد

جدول علي بابا الرسمي، بتشغيل داخلي يوم الإعلان، يعطي 86.1 في OSWorld-Verified و93.0 في PaperBench و82.8 في IFBench و92.6 في GPQA Diamond و86.6 في Terminal-Bench 2.1 و67.7 في SWE-bench Pro. والجدول نفسه يكشف الوجه الآخر: في Terminal-Bench 86.6 مقابل 88.8 لـGPT-5.6 Sol، وفي SWE-bench Pro 67.7 مقابل 80.0 لكلود فيبل 5، أي فجوة 12.3 نقطة في اختبار هندسة برمجيات؛ بينما يتقدّم في OSWorld-Verified على كلود فيبل 5 عند 85.0 وGPT-5.6 Sol عند 83.2.

والدرس يظهر حين يُقاس اختبار واحد ثلاث مرات:

بيئة القياسTerminal-Bench 2.1
علي بابا (تشغيل داخلي)86.6%
Artificial Analysis81.3%
Vals AI67.4%

السبب معلن في حواشي علي بابا نفسها: مهلة زمنية مُعدَّلة إلى خمس ساعات، بينما قواعد اللوحة الرسمية تمنع تعديل المهل أو الموارد. لكن الانحراف ليس عاماً: الأرقام المعرفية والرياضية تتكرّر بلا مشكلة، والفجوة محصورة في الأرقام الوكيلية، لأنها تقيس النموذج والمنظومة معاً لا النموذج وحده.

القياس المحايد يضعه عند مؤشر ذكاء 58 والمرتبة 13 من 187 نموذجاً لدى Artificial Analysis، لكن بزمن أول رمز 2.51 ثانية وسرعة إخراج نحو 20.7 رمزاً في الثانية، أي المرتبة 147 من 187: ردّ من 600 رمز يستغرق نحو نصف دقيقة أمام المستخدم. وحين تقارن، قِس 81.3 بأرقام المنافسين على المنصّة نفسها؛ أما 88.8 فرقم يخصّ بيئة المصنّع.

أين تتسرّب الكلفة رغم السعر المنخفض

سعر سنغافورة 2 دولار لكل مليون رمز دخل و6 دولارات لكل مليون رمز خرج، ثابت عبر كامل نافذة المليون رمز بلا تسعير متدرّج حسب طول السياق.

النموذجدخل (دولار/مليون رمز)خرج (دولار/مليون رمز)
qwen3.8-max (سنغافورة)2.006.00
GPT-5.6 Sol4.0020.00
GPT-5.6 Terra2.0012.00
كلود أوبس 55.0025.00
Gemini 3.1 Pro2.0012.00

الميزة السعرية مركّزة في الخرج تحديداً، وتتضاعف في السياق الطويل: Gemini 3.1 Pro يقفز إلى 4.00 / 18.00 فوق 200 ألف رمز، بينما لا يفرض qwen3.8-max علاوة تدرّج. ولاحظ أن جدول القياسات يقارن بكلود فيبل 5 الأعلى أداءً، وجدول السعر بأوبس 5 الأقرب سعراً. والأسعار تتحرّك أسرع من دورات الإصدار، كما حين أطلقت قوقل Gemini 3.7 Flash بخصم 50% للمطورين.

لكن الأرخص على الورق ليس الأرخص في الفاتورة: التفكير مفعّل افتراضياً بقيمة xhigh فيضخّم رموز الخرج، وهي أغلى من الدخل بثلاثة أضعاف. ابدأ خفض الفاتورة بضبط reasoning_effort إلى medium أو low في المهام البسيطة.

وللتخزين المؤقت وضعان بحسب توثيق المنصّة: ضمني تلقائي بلا إعداد، بفوترة 100% عند الإنشاء و20% عند الإصابة؛ وصريح بوسم يدوي بحدّ أدنى 1,024 رمزاً وعمر افتراضي خمس دقائق يُعاد ضبطه عند كل إصابة، بفوترة 125% عند الإنشاء و10% عند الإصابة. الصريح يربح إذا كان سياقك طويلاً ومتكرّراً خلال دقائق، وإلا فالضمني أسلم لأنه لا يفرض علاوة 25%. وصفحة النموذج تذكر أن الضبط الدقيق والاستدلال الدفعي غير مدعومين، فلا تبنِ خطتك عليهما.

الإقليم يغيّر سعرك وحدودك وحصتك المجانية

الأقاليم المتاحة: بكين وهونغ كونغ وسنغافورة وطوكيو وفرانكفورت وفرجينيا. لا إقليم خليجي، وأقربها جغرافياً فرانكفورت. لكن الفارق أعمق من زمن الاستجابة:

البندسنغافورةفرانكفورت وبقية الأقاليم
دخل/خرج لكل مليون رمز2.00 / 6.00 دولار1.65 / 4.951 دولار
حدّ الطلبات في الدقيقة15,00030,000
حدّ الرموز في الدقيقة2 مليون5 ملايين
حصة مليون رمز مجانية لـ90 يوماًمتاحةغير متاحة

فرانكفورت أرخص بنحو 17.5% وحدودها ضعف حدود سنغافورة، لكن الحصة المجانية مقصورة على الأخيرة؛ فالمسار الأنسب: جرّب على الحصة المجانية في سنغافورة، وانقل الإنتاج إلى فرانكفورت. وحدود المعدّل تُحتسب على مستوى الحساب كاملاً بتجميع كل المفاتيح ومساحات العمل، لا لكل مفتاح؛ وهو خطأ شائع ينتهي برمز HTTP 429.

أما سيادة البيانات فإشعار الخصوصية الرسمي ينصّ على أن البيانات لا تُستخدم في تدريب النماذج، والتشفير AES-256، والمنصّة حاصلة على شهادة SOC 2؛ ومدّة الاحتفاظ بالطلبات غير مذكورة صراحة، وبيانات القياس تُحفظ 30 يوماً. ومن يحتاج إلى إبقاء البيانات داخل السعودية فنظام حماية البيانات الشخصية يشترط للنقل خارج المملكة موافقة صريحة أو تقييم كفاية أو ضمانات معتمدة، وهو بند يُخطَّط له في مرحلة التصميم. والشركة السعودية للحوسبة السحابية تشغّل إقليم الرياض وتتيح نشر Qwen ذاتياً أو هجيناً، لكن لم يتأكّد أن نقطة النهاية المُدارة تُخدَم منه.

أول استدعاء ناجح وما يكسره الانتقال من واجهة OpenAI

معرّف النموذج qwen3.8-max، ومتغيّر المفتاح DASHSCOPE_API_KEY، وهناك طبقة توافق مع واجهة OpenAI. التوثيق الحالي يعرض عناوين نهاية مرتبطة بمساحة العمل بصيغة https://{WorkspaceId}.{region}.maas.aliyuncs.com/compatible-mode/v1، بينما لا يزال العنوان العالمي https://dashscope-intl.aliyuncs.com/compatible-mode/v1 موثَّقاً ومستخدَماً، فتحقّق من الصيغة التي تعمل مع حسابك:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DASHSCOPE_API_KEY"],
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)

stream = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[{"role": "user", "content": "لخّص هذا التقرير في خمس نقاط."}],
    stream=True,
    stream_options={"include_usage": True},
    extra_body={"enable_thinking": True, "reasoning_effort": "medium"},
)

for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="")

وما ينكسر عند الانتقال:

  • إغفال enable_thinking: الأدوات التي تستخدم مُهايئ OpenAI العام لا ترسله، فتردّ الخدمة بخطأ يطلب ضبطه على false في النداءات غير المتدفّقة. مرّره داخل extra_body أو استخدم البثّ.
  • الجمع بين reasoning_effort وthinking_budget: غير مدعوم هنا، فاختر واحداً.
  • المعاملات خارج مواصفة OpenAI: تحتاج extra_body في بايثون، بينما تُمرَّر في المستوى الأعلى في Node.
  • اكتشاف النماذج تلقائياً: على نقطة النهاية المتوافقة مع واجهة أنثروبيك، التي تتيح تشغيل كلود كود فوق النموذج مباشرة، يعيد مسار /v1/models رمز 404 فيلزمك تعريف يدوي. ومفارقةٌ أن الشركة سبق أن حظرت كلود كود على موظفيها.
  • عدد الصور: بحسب دليل الرؤية في المنصّة لا حدّ ثابت له؛ العدد محكوم بميزانية الرموز الكلّية، وصورة واحدة في مثال التوثيق استهلكت 1,247 رمزاً.

علاوة الرموز العربية وغياب قياس عربي للنموذج

لم يُنشر حتى وقت الكتابة أي قياس عربي لهذا النموذج، وجدول الإطلاق لا يضمّ اختباراً عربياً واحداً. الدليل المتاح غير مباشر: لوحة QIMMA من معهد الابتكار التقني، المبنية على 52,000 عيّنة من 14 مقياساً بمسار تحقّق آلي ثم مراجعة بشرية من ناطقين بالعربية، وضعت Qwen3.5-397B في المرتبة الأولى بمتوسط 68.06 وصدارة مقياسَي الشيفرة بالعربية. فالعائلة أثبتت نفسها عربياً؛ أما هذا الإصدار فبلا قياس.

والأهمّ عملياً علاوة الترميز. العربية تُفكَّك إلى رموز أكثر من الإنجليزية في كل العائلات؛ قياس 2026 على مُرمِّز o200k_base يضع العلاوة عند 1.44 ضعف، ولم يُنشر قياس مكافئ لمُرمِّز Qwen3.8. فخذها مؤشّراً: تقدير فاتورتك بعدد الكلمات الإنجليزية يقلّ عن الواقع، ولا يحسمه إلا تمرير نصّك العربي في المُرمِّز وعدّ الرموز. ولأن نصّ الأمر يستهلك رموز دخل في كل نداء، فاختصاره مكسب متكرّر يعالجه دليل كيف تكتب أوامر فعّالة لنماذج الذكاء الاصطناعي مثل كلود.

موانع التبنّي التي لا يحلّها السعر

لا تبدأ به إن كانت إقامة البيانات داخل الخليج إلزامية عندك، أو كنت تحتاج تعويضاً قانونياً عن المخرجات، فقد أشار محلّل غارتنر نيتيش تياغي إلى أن النماذج مفتوحة الأوزان تفتقر عادةً إلى الحماية التي يقدّمها مزوّدون تجاريون منافسون. واستبعده في التجارب التفاعلية الحسّاسة للزمن، فـ20.7 رمزاً في الثانية بطيء أمام المستخدم، وفي أي مسار يعتمد على الضبط الدقيق لأنه غير مدعوم، وفي مهام هندسة البرمجيات الطويلة حيث فجوة 12.3 نقطة في SWE-bench Pro لا تزال قائمة، وفي أي نشاط «نموذج كخدمة» تتجاوز إيراداته 50 مليون دولار لأنه يستلزم رخصة منفصلة.

ويبقى موضع تفوّقه واضحاً: أحمال نصّية كبيرة حسّاسة للكلفة، وسياق طويل يستفيد من سعر ثابت بلا تدرّج، وفريق يملك وقتاً ليقيس بنفسه بدلاً من الاكتفاء بجداول المصنّع. خارج هذا النطاق، الفارق السعري لا يغطّي ما تدفعه في الامتثال والزمن.