| 1 |
GPT-5.5 Pre Release no overall score |
OpenAI |
99.1% |
382.5/386 |
3 |
— |
| 2 |
GPT-5.5 Pro Pre Release no overall score |
OpenAI |
98.6% |
380.5/386 |
3 |
— |
| 3 |
GPT-5.4 Pro (2026-03-05) no overall score |
OpenAI |
97.7% |
317.5/325 |
4 |
— |
| 4 |
Claude Opus 5 |
Anthropic |
96.5% |
371.5/385 |
3 |
1 |
| 5 |
Qwen3.8 Max no overall score |
Alibaba |
96.6% |
311/322 |
2 |
— |
| 6 |
Gemini 3.7 Flash no overall score |
Google DeepMind |
94.8% |
365/385 |
3 |
— |
| 7 |
Grok 4.6 |
xAI |
93.6% |
360.5/385 |
3 |
5 |
| 8 |
Gemini 3.1 Pro Preview |
Google DeepMind |
93.5% |
453.5/485 |
5 |
17 |
| 9 |
Grok 4.5 |
xAI |
92.9% |
357.5/385 |
3 |
11 |
| 10 |
DeepSeek V4 Pro 0813 no overall score |
DeepSeek |
92.5% |
356/385 |
3 |
— |
| 11 |
GPT-5.6 Sol |
OpenAI |
91.6% |
352.5/385 |
3 |
2 |
| 12 |
Qwen3.7 Max no overall score |
Alibaba |
91.8% |
295.5/322 |
2 |
— |
| 13 |
Kimi K2.6 |
Moonshot |
91.3% |
352.5/386 |
3 |
18 |
| 14 |
Claude Opus 4.8 |
Anthropic |
90.2% |
405/449 |
4 |
6 |
| 15 |
GPT-5.4 (2026-03-05) |
OpenAI |
89.0% |
431.5/485 |
5 |
7 |
| 16 |
DeepSeek V4 Pro no overall score |
DeepSeek |
89.8% |
289/322 |
2 |
— |
| 17 |
GLM-5.3-Flash no overall score |
Z.ai (Zhipu AI) |
89.3% |
287.5/322 |
2 |
— |
| 18 |
DeepSeek V4 Flash 0731 no overall score |
DeepSeek |
88.1% |
339/385 |
3 |
— |
| 19 |
Kimi K3 |
Moonshot |
87.9% |
338.5/385 |
3 |
4 |
| 20 |
Gemini 3 Pro Preview |
Google DeepMind |
85.6% |
415/485 |
5 |
20 |
| 21 |
GLM-5.3 |
Z.ai (Zhipu AI) |
86.6% |
279/322 |
2 |
8 |
| 22 |
Kimi K2.7 Code |
Moonshot |
86.3% |
278/322 |
2 |
23 |
| 23 |
Muse Spark no overall score |
Meta AI |
85.8% |
362/422 |
4 |
— |
| 24 |
Claude Fable 5 |
Anthropic |
84.8% |
326.5/385 |
3 |
3 |
| 25 |
GLM 5.1 |
Z.ai (Zhipu AI) |
85.5% |
361/422 |
4 |
25 |
| 26 |
Grok 4.3 no overall score |
xAI |
85.9% |
276.5/322 |
2 |
— |
| 27 |
Grok 4.20 (Reasoning) no overall score |
xAI |
85.4% |
275/322 |
2 |
— |
| 28 |
Claude Opus 4.6 |
Anthropic |
83.7% |
406/485 |
5 |
15 |
| 29 |
GPT-5.2 (2025-12-11) |
OpenAI |
82.3% |
399/485 |
5 |
19 |
| 30 |
Qwen3.6 Plus no overall score |
Alibaba |
82.4% |
318/386 |
3 |
— |
| 31 |
Claude Opus 4.7 |
Anthropic |
80.0% |
388/485 |
5 |
9 |
| 32 |
GPT-5.6 Terra |
OpenAI |
79.5% |
306/385 |
3 |
12 |
| 33 |
Gemini 3.5 Flash no overall score |
Google |
79.0% |
354.5/449 |
4 |
— |
| 34 |
Kimi K2p5 no overall score |
Moonshot |
79.8% |
308/386 |
3 |
— |
| 35 |
Inkling no overall score |
Thinking Machines |
78.6% |
302.5/385 |
3 |
— |
| 36 |
Inkling Small no overall score |
Thinking Machines |
77.0% |
296.5/385 |
3 |
— |
| 37 |
Qwen3.6 Max Preview no overall score |
Alibaba |
77.7% |
300/386 |
3 |
— |
| 38 |
GPT-5 Pro (2025-10-06) no overall score |
OpenAI |
69.7% |
69/99 |
2 |
— |
| 39 |
Nemotron 3 Ultra (free) no overall score |
NVIDIA |
73.9% |
238/322 |
2 |
— |
| 40 |
Gemini 3 Flash Preview |
Google DeepMind |
70.8% |
318/449 |
4 |
21 |
| 41 |
Gemini 3.6 Flash no overall score |
Google DeepMind |
71.0% |
273.5/385 |
3 |
— |
| 42 |
GPT-5.4 mini (2026-03-17) no overall score |
OpenAI |
70.3% |
315.5/449 |
4 |
— |
| 43 |
Grok 4.0709 no overall score |
xAI |
70.2% |
315/449 |
4 |
— |
| 44 |
GLM-5.2 |
Z.ai (Zhipu AI) |
70.3% |
270.5/385 |
3 |
14 |
| 45 |
GPT-5 (2025-08-07) |
OpenAI |
69.4% |
336.5/485 |
5 |
27 |
| 46 |
Qwen3.5 Plus no overall score |
Alibaba |
71.4% |
275.5/386 |
3 |
— |
| 47 |
DeepSeek Reasoner no overall score |
DeepSeek |
72.0% |
232/322 |
2 |
— |
| 48 |
Qwen3.5 397B A17B no overall score |
Alibaba |
71.4% |
230/322 |
2 |
— |
| 49 |
Kimi K2.5 |
Moonshot |
61.6% |
61/99 |
2 |
28 |
| 50 |
Claude Sonnet 4.6 |
Anthropic |
67.9% |
305/449 |
4 |
22 |
| 51 |
Claude 4.5 Opus |
Anthropic |
66.6% |
323/485 |
5 |
24 |
| 52 |
Z-Ai/GLM 5 no overall score |
Z.ai (Zhipu AI) |
66.7% |
299.5/449 |
4 |
— |
| 53 |
Gemini 2.5 Pro |
Google DeepMind |
65.9% |
296/449 |
4 |
34 |
| 54 |
Kimi K2 Thinking Turbo no overall score |
Moonshot |
69.3% |
223/322 |
2 |
— |
| 55 |
Gemini 2.5 Pro Experimental 0325 no overall score |
Google DeepMind |
66.9% |
132.5/198 |
2 |
— |
| 56 |
Qwen3.6 Flash no overall score |
Alibaba |
65.7% |
253.5/386 |
3 |
— |
| 57 |
GPT-OSS 120B |
OpenAI |
65.4% |
210.5/322 |
2 |
35 |
| 58 |
o3 (2025-04-16) |
OpenAI |
60.9% |
295.5/485 |
5 |
29 |
| 59 |
Qwen3.5 Flash no overall score |
Alibaba |
63.0% |
243/386 |
3 |
— |
| 60 |
Qwen3 235B A22B Thinking 2507 no overall score |
Alibaba |
62.8% |
242.5/386 |
3 |
— |
| 61 |
Qwen3.7 Plus no overall score |
Alibaba |
63.4% |
204/322 |
2 |
— |
| 62 |
Qwen3.6 27B no overall score |
Alibaba |
62.9% |
202.5/322 |
2 |
— |
| 63 |
GPT-5.6 Luna |
OpenAI |
59.7% |
230/385 |
3 |
16 |
| 64 |
Qwen3.6 35B A3B no overall score |
Alibaba |
62.7% |
202/322 |
2 |
— |
| 65 |
GPT-5.5 |
OpenAI |
59.2% |
228/385 |
3 |
10 |
| 66 |
Claude Sonnet 5 |
Anthropic |
62.1% |
200/322 |
2 |
13 |
| 67 |
Z-Ai/GLM 4.7 no overall score |
Z.ai (Zhipu AI) |
60.5% |
233.5/386 |
3 |
— |
| 68 |
Qwen3.7 Flash no overall score |
Alibaba |
61.6% |
198.5/322 |
2 |
— |
| 69 |
Gemini 2.5 Pro Preview 0605 no overall score |
Google DeepMind |
54.0% |
175.5/325 |
4 |
— |
| 70 |
o4 mini (2025-04-16) no overall score |
OpenAI |
56.0% |
271.5/485 |
5 |
— |
| 71 |
GPT-5.1 (2025-11-13) |
OpenAI |
55.7% |
270/485 |
5 |
26 |
| 72 |
GPT-5.5 Instant no overall score |
OpenAI |
59.6% |
192/322 |
2 |
— |
| 73 |
Claude Sonnet 4.5 |
Anthropic |
54.2% |
263/485 |
5 |
31 |
| 74 |
GPT-5 mini (2025-08-07) no overall score |
OpenAI |
54.1% |
262.5/485 |
5 |
— |
| 75 |
Gemini 2.5 Flash Preview no overall score |
Google DeepMind |
56.6% |
111/196 |
2 |
— |
| 76 |
Gemma 4 26B A4B IT no overall score |
Google DeepMind |
58.1% |
187/322 |
2 |
— |
| 77 |
GPT-5.4 Nano (2026-03-17) no overall score |
OpenAI |
53.6% |
240.5/449 |
4 |
— |
| 78 |
Gemini 2.5 Flash 0520 no overall score |
Google DeepMind |
51.4% |
133/259 |
3 |
— |
| 79 |
Gemma 4 31B IT no overall score |
Google DeepMind |
56.4% |
181.5/322 |
2 |
— |
| 80 |
o1 (2024-12-17) no overall score |
OpenAI |
53.2% |
224.5/422 |
4 |
— |
| 81 |
Qwen3 Max (2025-09-23) no overall score |
Alibaba |
54.2% |
174.5/322 |
2 |
— |
| 82 |
Claude 4.1 Opus |
Anthropic |
50.1% |
211.5/422 |
4 |
32 |
| 83 |
o3 mini (2025-01-31) no overall score |
OpenAI |
48.2% |
216.5/449 |
4 |
— |
| 84 |
DeepSeek-R1-0528 no overall score |
DeepSeek |
48.8% |
188/385 |
3 |
— |
| 85 |
Gemini 3.5 Flash Lite no overall score |
Google DeepMind |
47.9% |
184.5/385 |
3 |
— |
| 86 |
Qwen3.5 9B no overall score |
Alibaba |
49.4% |
159/322 |
2 |
— |
| 87 |
Grok 3 mini Beta no overall score |
xAI |
46.9% |
181/386 |
3 |
— |
| 88 |
MiniMax-M3 |
MiniMax |
47.8% |
154/322 |
2 |
30 |
| 89 |
Claude 4 Sonnet |
Anthropic |
41.6% |
202/485 |
5 |
37 |
| 90 |
Gemini 2.5 Pro Preview 0506 no overall score |
Google DeepMind |
43.9% |
87/198 |
2 |
— |
| 91 |
Claude 3.7 Sonnet |
Anthropic |
41.2% |
200/485 |
5 |
36 |
| 92 |
Claude 4 Opus |
Anthropic |
41.0% |
199/485 |
5 |
33 |
| 93 |
Gemini 3.1 Flash Lite no overall score |
Google |
45.0% |
161/358 |
3 |
— |
| 94 |
DeepSeek-R1 no overall score |
DeepSeek |
43.1% |
166/385 |
3 |
— |
| 95 |
DeepSeek Chat no overall score |
DeepSeek |
45.3% |
146/322 |
2 |
— |
| 96 |
Grok 3 Beta no overall score |
xAI |
42.7% |
165/386 |
3 |
— |
| 97 |
Qwq 32B no overall score |
Alibaba |
44.7% |
144/322 |
2 |
— |
| 98 |
Gemini 2.0 Flash Thinking Exp 01.21 no overall score |
Google DeepMind,Google |
40.1% |
143.5/358 |
3 |
— |
| 99 |
Claude Haiku 4.5 no overall score |
Anthropic |
36.9% |
165.5/449 |
4 |
— |
| 100 |
DeepSeek-V3-0324 no overall score |
DeepSeek |
41.5% |
133.5/322 |
2 |
— |
| 101 |
GPT-4.1 (2025-04-14) no overall score |
OpenAI |
35.1% |
170/485 |
5 |
— |
| 102 |
GPT-4.5 Preview (2025-02-27) no overall score |
OpenAI |
35.9% |
151/421 |
4 |
— |
| 103 |
OpenAI GPT-4.1 Mini no overall score |
OpenAI |
35.7% |
160.5/449 |
4 |
— |
| 104 |
GPT-5 Nano (2025-08-07) no overall score |
OpenAI |
35.7% |
160.5/449 |
4 |
— |
| 105 |
Gemini 2.0 Flash 001 no overall score |
Google DeepMind,Google |
34.2% |
153.5/449 |
4 |
— |
| 106 |
o1 mini (2024-09-12) no overall score |
OpenAI |
34.2% |
153.5/449 |
4 |
— |
| 107 |
R1 Distill Llama 70B no overall score |
DeepSeek |
39.1% |
126/322 |
2 |
— |
| 108 |
GPT-OSS 20B no overall score |
OpenAI |
37.6% |
121/322 |
2 |
— |
| 109 |
Gemini 1.5 Pro 002 no overall score |
Google DeepMind |
30.3% |
127.5/421 |
4 |
— |
| 110 |
Llama 4 Maverick 17b 128e Instruct no overall score |
Meta AI |
11.1% |
11/99 |
2 |
— |
| 111 |
Llama 4 Maverick 17B FP8 no overall score |
Meta AI |
33.0% |
127.5/386 |
3 |
— |
| 112 |
Mistral Medium 3 no overall score |
Mistral AI |
30.8% |
130/422 |
4 |
— |
| 113 |
Magistral Small 2506 no overall score |
Mistral AI |
30.0% |
115.5/385 |
3 |
— |
| 114 |
DeepSeek-V3 no overall score |
DeepSeek |
30.2% |
116.5/386 |
3 |
— |
| 115 |
o1 Preview (2024-09-12) no overall score |
OpenAI |
32.1% |
103.5/322 |
2 |
— |
| 116 |
Qwen2.5-Max-2025-01-25 no overall score |
Alibaba |
29.3% |
113/386 |
3 |
— |
| 117 |
Phi 4 no overall score |
Microsoft Research |
30.9% |
99.5/322 |
2 |
— |
| 118 |
Claude 3.5 Sonnet (2024-10-22) no overall score |
Anthropic |
25.9% |
109.5/422 |
4 |
— |
| 119 |
GPT-4.1 Nano (2025-04-14) no overall score |
OpenAI |
24.7% |
111/449 |
4 |
— |
| 120 |
Grok 2.1212 no overall score |
xAI |
26.3% |
101.5/386 |
3 |
— |
| 121 |
Gemma 3.27B It no overall score |
Google DeepMind |
28.0% |
90/322 |
2 |
— |
| 122 |
Llama 3.1 405B Instruct no overall score |
Meta AI |
27.6% |
89/322 |
2 |
— |
| 123 |
Qwen Plus (2025-01-25) no overall score |
Alibaba |
27.6% |
89/322 |
2 |
— |
| 124 |
Qwen 3 8B no overall score |
Alibaba |
27.2% |
87.5/322 |
2 |
— |
| 125 |
Claude 3.5 Sonnet (2024-06-20) no overall score |
Anthropic |
24.1% |
93/386 |
3 |
— |
| 126 |
Mistral Large 2407 no overall score |
Mistral AI |
25.9% |
83.5/322 |
2 |
— |
| 127 |
Qwen2.5 72B Instruct no overall score |
Alibaba |
25.8% |
83/322 |
2 |
— |
| 128 |
Mistral Large 2411 no overall score |
Mistral AI |
23.1% |
89/386 |
3 |
— |
| 129 |
Llama 4 Scout 17B 16E Instruct no overall score |
Meta AI |
20.3% |
91/449 |
4 |
— |
| 130 |
Gemini 1.5 Flash 002 no overall score |
Google DeepMind |
21.1% |
81.5/386 |
3 |
— |
| 131 |
GPT-4o (2024-08-06) no overall score |
OpenAI |
20.3% |
78.5/386 |
3 |
— |
| 132 |
GPT-4o (2024-05-13) no overall score |
OpenAI |
21.6% |
69.5/322 |
2 |
— |
| 133 |
Gemma 3 12B IT no overall score |
Google DeepMind |
21.4% |
69/322 |
2 |
— |
| 134 |
GPT-4o (2024-11-20) no overall score |
OpenAI |
15.5% |
75/485 |
5 |
— |
| 135 |
Qwen2.5 32B Instruct no overall score |
Alibaba |
20.2% |
65/322 |
2 |
— |
| 136 |
GPT-4 Turbo (2024-04-09) no overall score |
OpenAI |
19.9% |
64/322 |
2 |
— |
| 137 |
Mistral Small 2503 no overall score |
Mistral AI |
19.4% |
62.5/322 |
2 |
— |
| 138 |
Gemini 1.5 Pro 001 no overall score |
Google DeepMind |
19.3% |
62/322 |
2 |
— |
| 139 |
Llama 3.3 70B Instruct no overall score |
Meta AI |
18.3% |
59/322 |
2 |
— |
| 140 |
Claude 3 Opus (2024-02-29) no overall score |
Anthropic |
17.4% |
56/322 |
2 |
— |
| 141 |
GPT-4o-mini (2024-07-18) no overall score |
OpenAI |
14.5% |
56/385 |
3 |
— |
| 142 |
Mistral Small 2501 no overall score |
Mistral AI |
16.5% |
53/322 |
2 |
— |
| 143 |
Qwen Turbo (2024-11-01) no overall score |
Alibaba |
16.5% |
53/322 |
2 |
— |
| 144 |
Llama 3.1 Tulu 3.70B Dpo no overall score |
Allen Institute for AI,University of Washington |
16.1% |
52/322 |
2 |
— |
| 145 |
Llama 3.1 70b Instruct no overall score |
Meta AI |
13.7% |
44/322 |
2 |
— |
| 146 |
Meta Llama 3.70B Instruct no overall score |
Meta AI |
13.2% |
42.5/322 |
2 |
— |
| 147 |
Claude 3.5 Haiku (2024-10-22) no overall score |
Anthropic |
10.9% |
42/386 |
3 |
— |
| 148 |
Llama-3.2-90B-Vision-Instruct no overall score |
Meta AI |
12.7% |
41/322 |
2 |
— |
| 149 |
Gemini 1.5 Flash 001 no overall score |
Google DeepMind |
12.4% |
40/322 |
2 |
— |
| 150 |
Claude 3 Sonnet (2024-02-29) no overall score |
Anthropic |
11.8% |
38/322 |
2 |
— |
| 151 |
Gemma 3 4B IT no overall score |
Google DeepMind |
11.8% |
38/322 |
2 |
— |
| 152 |
Gemini 1.5 Flash 8B 001 no overall score |
Google DeepMind |
10.1% |
32.5/322 |
2 |
— |
| 153 |
Hermes 2 Theta Llama 3.70B no overall score |
Nous Research,Arcee AI |
9.6% |
31/322 |
2 |
— |
| 154 |
Mistral Large 2402 no overall score |
Mistral AI |
9.5% |
30.5/322 |
2 |
— |
| 155 |
Claude 2.0 no overall score |
Anthropic |
8.4% |
27/322 |
2 |
— |
| 156 |
Anthropic: Claude 3 Haiku no overall score |
Anthropic |
7.5% |
24/322 |
2 |
— |
| 157 |
Gemma 2 27B no overall score |
Google DeepMind |
7.1% |
23/322 |
2 |
— |
| 158 |
Claude 2.1 no overall score |
Anthropic |
6.5% |
21/322 |
2 |
— |
| 159 |
GPT-3.5 Turbo 0125 no overall score |
OpenAI |
5.9% |
19/322 |
2 |
— |
| 160 |
Gemini 1.0 Pro 001 no overall score |
Google DeepMind |
5.3% |
17/322 |
2 |
— |
| 161 |
GPT-4.0314 no overall score |
OpenAI |
4.5% |
14.5/322 |
2 |
— |
| 162 |
GPT-4.0613 no overall score |
OpenAI |
4.3% |
14/322 |
2 |
— |
| 163 |
Llama 3.1 8B Instruct no overall score |
Meta AI |
4.3% |
14/322 |
2 |
— |
| 164 |
Gemma 2.9B It no overall score |
Google DeepMind |
2.6% |
8.5/322 |
2 |
— |
| 165 |
Meta Llama 3.8B Instruct no overall score |
Meta AI |
2.0% |
6.5/322 |
2 |
— |
| 166 |
Gemma 3.1B It no overall score |
Google DeepMind |
1.9% |
6/322 |
2 |
— |
| 167 |
Deepseek Llm 67B Chat no overall score |
DeepSeek |
1.7% |
5.5/322 |
2 |
— |
| 168 |
Llama 2.70B Chat Hf no overall score |
Meta AI |
1.2% |
4/322 |
2 |
— |