تقرير تقني · Idealistic Solutions LLC

النموذج نفسه، مضيفان اثنان، إجابات مختلفة

قياس الجزء الحقيقي من فجوة ظاهرية بين المزوّدين — والجزء الذي يعود إلى إطار الاختبار لديك

Eslam HasanenIdealistic Solutions LLC

الملخص §

وجّهنا نموذجًا مفتوح الأوزان، هو MiniMax-M3، عبر مزوّدَي استدلال مُستضاف — Together AI و Ollama Cloud — داخل منصة إنتاجية للتعاقدات الحكومية. أظهرت مقارنة غير مضبوطة تفوّق أحد المزوّدين بمقدار 9.7 نقطة على الآخر في المهمة نفسها وبالموجّه نفسه.

وبضبط متغيّرين اثنين داخل إطار التقييم لدينا، اختفت معظم تلك الفجوة. أُعيد قياس المهمة نفسها فكان الفارق 0.5 نقطة. أمّا ما بقي بعد الضبط فكان مجموعة اختلافات مختلفة وأصغر وأكثر تحديدًا.

الخلاصة العملية ليست أن أحد المزوّدين أفضل، بل أن الفارق الظاهري بين المزوّدين غير قابل للقياس افتراضيًا: عيبان عاديان في إطار الاختبار أنتجا فارقًا مقداره 9.7 نقطة، بقي منه 0.5 نقطة بعد إصلاحهما. ومن يقارن بين مزوّدي الاستدلال المُستضاف فالأرجح أنه يقيس منصّة اختباره هو.

1. سبب هذه الدراسة §

تُقدَّم النماذج مفتوحة الأوزان عبر مضيفين متعدّدين على نحو متزايد. فاسم نقطة التحقّق نفسه يظهر لدى عدة مزوّدين، والافتراض الطبيعي أن التوجيه إلى الأرخص أو الأسرع قرار تجاري بحت — أي أن النموذج هو النموذج.

تُسنِد منصّتنا نماذج مختلفة إلى مهام مختلفة (تقييم الفرص، تلخيص المستندات، صياغة العروض، المراجعة الخصمية، الترجمة، كتابة المواصفات). وقد بنينا إطار مقارنة كي تقوم هذه الإسنادات على الأدلة لا على التفضيل: يُرسَل الموجّه نفسه إلى N من النماذج، ثم يقوم نموذج تحكيم مُستبعَد من المنافسة بتقييم الإجابات بعد إخفاء هويّتها وخلط ترتيبها.

وبتشغيل ذلك الإطار سجّلنا لـ MiniMax-M3 نتيجة 78.5 على Ollama Cloud و 68.8 على Together في التلخيص بلغة مبسّطة. الأوزان نفسها، والموجّه نفسه، والمحكّم نفسه. وهي فجوة كبيرة بما يكفي لتوجيه حركة الإنتاج بناءً عليها، فحاولنا تفسيرها.

2. عيبان في إطار الاختبار §

2.1 لم تُحدَّد درجة حرارة الاعتيان إطلاقًا §

كان عميلنا يرسل {model, max_tokens, messages} لا غير. بلا temperature، وبلا top_p.

يطبّق كل مزوّد قيمته الافتراضية عند إغفال معاملات الاعتيان، وهذه القيم ليست الرقم نفسه. لم نكن نطرح السؤال نفسه على المضيفَين. فالمقارنة لم تكن تقيس النموذج، بل كانت تقيس جزئيًا نظامَي اعتيان مختلفين.

2.2 لم يستخدم الإطار ميزانيات الرموز الخاصة بالإنتاج §

كانت كل مهمة في الإطار تعمل بحدّ ثابت قدره 1,500 رمز مخرجات. أما الإنتاج فكان يمرّر ما بين 1,200 و 6,000 بحسب المهمة.

وهذا ليس تباينًا طفيفًا بالنسبة إلى النماذج الاستدلالية. فالنموذج الاستدلالي ينفق ميزانيته على استدلال خفيّ قبل أن يُخرج حرفًا واحدًا مرئيًا، ولذلك فإن تجويع الميزانية لا يُنتج إجابة أقصر — بل لا يُنتج إجابة إطلاقًا. وفي المهمة التي تبلغ ميزانيتها الإنتاجية 6,000، أعادت أربعة من ستة نماذج قيد الاختبار استدلالًا بلا نص. فسجّلها الإطار على أنها إخفاقات للنموذج، وأوصى بخامس أفضل نموذج لتلك المهمة.

والانحياز هنا ذو اتجاه واحد: تجويع الميزانية يُفضّل منهجيًا النماذج التي تفكّر أقلّ قبل الإجابة.

3. المنهجية §

المنصة. خدمة SaaS حيّة متعدّدة المستأجرين لاكتشاف الفرص الفيدرالية الأمريكية وإعداد العطاءات. وجميع الموجّهات هي موجّهات الإنتاج نفسها لا صياغات معادة — فالموجّه المعاد صياغته يقيس الإطار لا النموذج.

المتنافسان. together/MiniMaxAI/MiniMax-M3 و Ollama/minimax-m3:cloud — وهو اسم النموذج نفسه كما ينشره كل مضيف.

المحكّم. OpenAI/gpt-5.6-luna، مُستبعَد من ساحة المتنافسين. فالمحكّم الذي ينافس أيضًا يمنح كل إجابة تقييمًا أعلى بمقدار 5–11 نقطة دون أن يغيّر الترتيب، ما يجعل الخلايا غير قابلة للمقارنة، ولذلك يُستبعَد بدل الاكتفاء بالتنويه. وتُخفى هوية الإجابات وتُخلط قبل التقييم؛ ويرى المحكّم رأس الموجّه وذيله معًا، لأن الاقتطاع من الرأس وحده أخفى ذات مرة المستند قيد المراجعة وقلب عمودًا كاملًا من النتائج.

المهام. تسع مهام إنتاجية: تقييم الملاءمة، التلخيص بلغة مبسّطة، أسئلة للمشتري، صياغة قسم من العرض، ملخّص البناء، المراجعة الخصمية، الترجمة العربية، صياغة مواصفات البناء، ونسخ الصفحات الممسوحة ضوئيًا.

المتن. ثلاثة إعلانات مناقصة حقيقية مختلفة الطول والمصدر (73.9k و 86.9k و 17.6k حرفًا)، بتشغيلين لكل منها.

الضوابط المطبَّقة قبل القياس النهائي.

  1. تثبيت درجة حرارة الاعتيان صراحةً عند 0.2 لكل مزوّد.
  2. تشغيل كل مهمة عند ميزانية الرموز نفسها التي يمرّرها مستدعيها في الإنتاج (1,200 / 2,000 / 2,500 / 4,000 / 6,000 بحسب المهمة).

يعتمد الترتيب على متوسط الموقع لا متوسط الدرجة: فبالقياس عبر متننا، حصل المجال كله على 39–66 في إعلان، وعلى 78–94 في آخر، ومن ثمّ فإن متوسط الدرجات الخام يسجّل في معظمه أي المستندات صادف أن يسحبها النموذج.

4. النتائج §

4.1 الفجوة تختفي إلى حدّ بعيد تحت الضبط §

4.1 الفجوة تختفي إلى حدّ بعيد تحت الضبط
القياسTogetherOllama Cloudالفارق
التلخيص، غير مضبوط68.878.59.7
التلخيص، مضبوط75.576.00.5

4.2 النتائج المضبوطة لجميع المهام القابلة للقياس §

درجات المحكّم، 0–100. والإخفاقات هي الاستدعاءات التي لم تُعِد نصًا صالحًا.

4.2 النتائج المضبوطة لجميع المهام القابلة للقياس
المهمةTogetherOllama Cloud
تقييم الملاءمة64.754.7
أسئلة للمشتري87.384.0
قسم من العرض74.270.7
ملخّص البناء77.575.8
الترجمة العربية71.8 (إخفاق 1)69.0
تلخيص بلغة مبسّطة75.576.0
نسخ الصفحات الممسوحة96.597.5
المراجعة الخصمية79.079.0
المتوسط عبر 8 مهام78.375.8
الاستدعاءات المخفقة35
TogetherOllama Cloud
  • تقييم الملاءمة
    تقييم الملاءمة · Together 64.764.7
    تقييم الملاءمة · Ollama Cloud 54.754.7
  • أسئلة للمشتري
    أسئلة للمشتري · Together 87.387.3
    أسئلة للمشتري · Ollama Cloud 84.084.0
  • قسم من العرض
    قسم من العرض · Together 74.274.2
    قسم من العرض · Ollama Cloud 70.770.7
  • ملخّص البناء
    ملخّص البناء · Together 77.577.5
    ملخّص البناء · Ollama Cloud 75.875.8
  • الترجمة العربية
    الترجمة العربية · Together 71.871.8(إخفاق 1)
    الترجمة العربية · Ollama Cloud 69.069.0
  • تلخيص بلغة مبسّطة
    تلخيص بلغة مبسّطة · Together 75.575.5
    تلخيص بلغة مبسّطة · Ollama Cloud 76.076.0
  • نسخ الصفحات الممسوحة
    نسخ الصفحات الممسوحة · Together 96.596.5
    نسخ الصفحات الممسوحة · Ollama Cloud 97.597.5
  • المراجعة الخصمية
    المراجعة الخصمية · Together 79.079.0
    المراجعة الخصمية · Ollama Cloud 79.079.0
شكل 1. درجات المحكّم المضبوطة بحسب المهمة، 0–100. الأعمدة هي القيم نفسها الواردة في الجدول أعلاه؛ مرّر المؤشر أو ركّز على عمود لقراءة قيمته.

تعذّر قياس صياغة مواصفات البناء: ففي كل تشغيل أعاد متنافس واحد على الأقل لا شيء، فلم يبقَ أمام المحكّم سوى إجابة واحدة وبلا ترتيب يصنعه. ونحن نُبلغ عنها بوصفها غير مقيسة لا بوصفها نتيجة.

ما يبقى بعد الضبط هو فارق حاسم واحد — تقييم الملاءمة، بفارق 10.0 نقطة لصالح Together — وشبه تعادل في ستٍّ من المهام السبع الباقية. والمهمتان اللتان تتقدّم فيهما Ollama Cloud فارقهما أقل من نقطة.

4.3 الفروق التشغيلية أكبر من فروق الجودة §

من قياسات الإنتاج عن الفترة نفسها:

4.3 الفروق التشغيلية أكبر من فروق الجودة
المؤشرTogetherOllama Cloud
الاستدعاءات المسجّلة294162
الاستدعاءات المخفقة2 (0.7%)5 (3.1%)
متوسط زمن الاستجابة19.5 s10.7 s
TogetherOllama Cloud

الاستدعاءات المسجّلة

Together
الاستدعاءات المسجّلة · Together 294294
Ollama Cloud
الاستدعاءات المسجّلة · Ollama Cloud 162162

الاستدعاءات المخفقة

Together
الاستدعاءات المخفقة · Together 2 (0.7%)2 (0.7%)
Ollama Cloud
الاستدعاءات المخفقة · Ollama Cloud 5 (3.1%)5 (3.1%)

متوسط زمن الاستجابة

Together
متوسط زمن الاستجابة · Together 19.5 s19.5 s
Ollama Cloud
متوسط زمن الاستجابة · Ollama Cloud 10.7 s10.7 s
شكل 2. قياسات الإنتاج. كل لوحة مقيسة إلى حدّها الأقصى الخاص لأن المؤشرات الثلاثة لا تشترك في وحدة واحدة — وهي ليست مرسومة على محور مشترك. رصدية لا مضبوطة.

أجابت Ollama Cloud أسرع بنحو 1.8×؛ وأخفقت Together بنحو 4× أقل. وشملت الإخفاقات المرصودة على Ollama Cloud انتهاء مهلة القراءة وإكمالات فارغة استهلك فيها الاستدلال الميزانية كلها.

هذه المقارنة رصدية لا مضبوطة: فالنقطتان الطرفيتان لم تتلقّيا مزيجًا متطابقًا من المهام خلال الفترة. ونحن نُبلغ عنها لأن حجم الأثر كبير ومتّسق، لا لأنها نظيفة تجريبيًا.

4.4 بعض النماذج ترفض درجة حرارة مثبَّتة §

من بين سبعة نماذج ثبّتنا لها القيمة، رفض اثنان — إذ تردّ العائلات الاستدلالية على درجة حرارة صريحة بالخطأ HTTP 400 ولا تقبل سوى قيمتها الافتراضية. وكان أحدهما محكّمنا. وأي عميل يثبّت الاعتيان عليه أن يكتشف ذلك من رسالة الخطأ ويعيد المحاولة دون المعامل، وإلا فقد بالضبط أكثر النماذج حساسية للاعتيان.

5. التفسير §

لم نُثبت سبب اختلاف المضيفَين حيث لا يزالان يختلفان. وأيٌّ ممّا يلي كفيل بتفسيره، ولم يكن بوسعنا التحقّق منه من الخارج: صيغة التكميم، أو اختلافات حزمة التقديم، أو مراجعة نقطة التحقّق، أو معاملات اعتيان متبقّية لا نضبطها (top_p و top_k وعقوبة التكرار).

لكننا أثبتنا أمرًا نراه أنفع:

الفارق الذي يُبلغ عنه إطار اختبار غير مضبوط بين مزوّدين قد يكون أضعافًا مضاعفة للفارق الذي يصمد بعد الضبط — وقد يشير إلى الاتجاه المعاكس.

قبل الضوابط كانت بياناتنا تقول: «وجّه التلخيص إلى Ollama Cloud بفارق 9.7 نقطة». وبعد الضوابط صارت تلك المهمة تعادلًا، وصار الفارق الحقيقي في مكان آخر تمامًا. والفريق الذي يتصرّف بناءً على القياس الأول كان سيتّخذ قرار توجيه مبنيًّا على أثر من صنع منصّة اختباره.

6. توصيات عملية §

لكل من يقارن بين مزوّدي الاستدلال المُستضاف:

  1. ثبّت الاعتيان صراحةً. إن لم ترسل temperature فأنت تقارن القيم الافتراضية لكل مزوّد بقدر ما تقارن النموذج. وتعامَل مع النماذج التي ترفضها.
  2. امنح الإطار ميزانيات الرموز الخاصة بالإنتاج. فالقياس عند ميزانية مختلفة عن الإنتاج يقيس نظامًا مختلفًا — كما أن تجويع النماذج الاستدلالية يحوّل فروق الجودة بصمت إلى أعداد إخفاق.
  3. فرّق بين استدعاء أخفق وإجابة رديئة. فقد خلط إطارنا بينهما، فقُرئ إخفاق سبّبه الإطار على أنه قصور في النموذج.
  4. أبقِ المحكّم خارج ساحة المنافسة. فالمحكّم المنافس يضخّم كل الدرجات دون أن يغيّر الترتيب.
  5. رتّب بالموقع لا بمتوسط الدرجة، إن كان متنك غير متجانس. وإلا فأنت تسجّل في معظم الأمر أي المستندات سحبها النموذج.
  6. سمِّ ما لم تستطع قياسه. فالمهمة التي تسقط بصمت من جدول النتائج تبدو كأنها لم تُطلب قط.

وللفرق التي تختار بين هذين المزوّدين تحديدًا: في حِمل عملنا يبقى فارق الجودة بعد الضبط صغيرًا ومرتبطًا بالمهمة، بينما فارق زمن الاستجابة والموثوقية كبير. وهذا يرجّح التوجيه بحسب الخصائص التشغيلية — السرعة حيث ينتظر إنسان، والموثوقية حيث يكلّف الاستدعاء الساقط عملًا ضائعًا — لا بحسب درجات الجودة الإجمالية.

7. حدود الدراسة §

  • النموذج بوصفه محكّمًا. الدرجات رأي نموذج واحد لا حقيقة مرجعية. ومهمة النسخ وحدها هي التي صُحّحت في مقابل مرجع (طبقة النص الأصلية في ملف PDF).
  • متن صغير. ثلاثة مستندات، وتشغيلان، ومجال واحد (التعاقدات الفيدرالية الأمريكية)، وزوج لغوي واحد للترجمة.
  • لقطة واحدة للمزوّدين. قيست في أواخر يوليو 2026. والمزوّدون يغيّرون إعدادات التقديم دون إشعار؛ وهذه الأرقام لحظة زمنية بعينها.
  • آلية غير محقَّقة. رصدنا فروقًا، ولم نحدّد سببها، ولم يكن لدينا وصول إلى إعدادات التقديم لدى أيٍّ من المضيفَين.
  • قياسات رصدية. لم تكن مقارنة معدّل الإخفاق وزمن الاستجابة تجربة مضبوطة.
  • تقرير ذاتي. هذا تقرير ممارس من واقع استخدام إنتاجي، لا بحث محكَّم.

8. الخلاصة §

أنتج مزوّدان يقدّمان النموذج مفتوح الأوزان نفسه نتائج مختلفة قابلة للقياس. وكان معظم الفارق الذي رصدناه أولًا راجعًا إلى أدواتنا نحن. أما البقية فحقيقية، لكنها أصغر ومختلفة الشكل عمّا أوحى به القياس الأصلي، وهي أصغر من الفروق التشغيلية بين المضيفَين.

إن كنت تختار بين مزوّدين لنموذج مفتوح الأوزان: اضبط إطار اختبارك أولًا، ثم قِس. وإلا فالرقم الذي توشك أن تتصرّف بناءً عليه قد يكون في معظمه عنك أنت.

إسلام حسانين هو مالك شركة Idealistic Solutions LLC التي تبني أنظمة ذكاء اصطناعي للتعاقدات الحكومية. للمراسلة: Eslam.H@IdealisticSolutions.com

لا توجد أي علاقة، تجارية أو غير تجارية، بين المؤلف وأيٍّ من المزوّدَين المذكورَين. وقد كان الاستخدام لدى كليهما استخدامًا تجاريًا مدفوعًا بالأسعار المعتادة.

كل الأبحاث