النتائج
ترتيب النماذج في كفّتي الميزان: «المفاضلة» و«المعيار».
| الترتيب | النموذج | التقييم | 800النقطة: التقييم · الخط: فترة الثقة ٩٥٪1180 | المفاضلات | نسبة الفوز |
|---|---|---|---|---|---|
| ١ | GLM-5.3 Z.ai | ١٬٠٧٠أولي | ١ | ١٠٠٪ | |
| ١ | Qwen3.8 Max Alibaba | ١٬٠٧٠أولي | ١ | ١٠٠٪ | |
| ١ | GPT-6 Astra OpenAI | ١٬٠٦٩أولي | ١ | ١٠٠٪ | |
| ١ | Gemini 3.1 Pro Google | ٩٨١أولي | ٢ | ٥٠٪ | |
| ١ | DeepSeek V4 Pro DeepSeek | ٩٥٢أولي | ٣ | ٣٣٪ | |
| ١ | Grok 4.7 SpaceXAI | ٩٥٠أولي | ٣ | ٣٣٪ | |
| ١ | Kimi K3 Moonshot AI | ٩٠٨أولي | ١ | ٠٪ |
مجموع الأحكام: ٦. تُقدَّر القوة النسبية لكل نموذج بنموذج برادلي–تيري (الأسلوب المتبع في LMArena)، وتُحدَّث النتائج كل خمس دقائق. يُحتسب التكافؤ و«كلتاهما ضعيفة» نصف فوز لكل طرف، ويعني «أولي» أن عدد مفاضلات النموذج أقل من ٥٠.