Model comparisons
190 matchups across 125 models. Click any to see the full breakdown.
GPT-5.5OpenAI
11-17
28 benchmarks
Claude Opus 4.8Anthropic
GPT-5.5OpenAI
2-26
28 benchmarks
GPT-5.6 SolOpenAI
Claude Opus 4.8Anthropic
7-19
27 benchmarks
GPT-5.6 SolOpenAI
GPT-5.5OpenAI
1-24
26 benchmarks
Claude Fable 5Anthropic
Claude Opus 4.8Anthropic
1-24
26 benchmarks
Claude Fable 5Anthropic
GPT-5.6 SolOpenAI
10-16
26 benchmarks
Claude Fable 5Anthropic
GPT-5.5OpenAI
1-23
25 benchmarks
Kimi K3Moonshot AI
Claude Opus 4.8Anthropic
3-22
25 benchmarks
Kimi K3Moonshot AI
GPT-5.6 SolOpenAI
9-15
25 benchmarks
Kimi K3Moonshot AI
Claude Fable 5Anthropic
14-10
25 benchmarks
Kimi K3Moonshot AI
Claude Opus 4.8Anthropic
17-4
21 benchmarks
GLM-5.2Z.ai
GPT-5.5OpenAI
13-5
18 benchmarks
GLM-5.2Z.ai
Claude Opus 4.7Anthropic
15-3
18 benchmarks
Claude Opus 4.6Anthropic
GPT-5.6 SolOpenAI
17-0
17 benchmarks
GLM-5.2Z.ai
Gemini 3.1 ProGoogle
8-9
17 benchmarks
GPT-5.4OpenAI
Claude Fable 5Anthropic
17-0
17 benchmarks
GLM-5.2Z.ai
Gemini 3.1 ProGoogle
8-8
16 benchmarks
Claude Opus 4.7Anthropic
Kimi K3Moonshot AI
16-0
16 benchmarks
GLM-5.2Z.ai
GPT-5.5OpenAI
11-4
15 benchmarks
Gemini 3.1 ProGoogle
GPT-5.5OpenAI
12-3
15 benchmarks
Claude Opus 4.7Anthropic
Gemma 4 31BGoogle
15-0
15 benchmarks
Gemma 4 26B A4BGoogle
GPT-5.5OpenAI
13-0
14 benchmarks
GPT-5.4OpenAI
Gemini 3.1 ProGoogle
8-5
14 benchmarks
Claude Opus 4.6Anthropic
GPT-5.4OpenAI
7-7
14 benchmarks
Claude Opus 4.6Anthropic
Claude Opus 4.7Anthropic
8-5
13 benchmarks
GPT-5.4OpenAI
Claude Opus 4.7Anthropic
8-4
12 benchmarks
Kimi K2.5Moonshot AI
Claude Opus 4.7Anthropic
9-3
12 benchmarks
Kimi K2.6Moonshot AI
Qwen 3.6 27BAlibaba
11-1
12 benchmarks
Qwen 3.6 35B-A3BAlibaba
GPT-5.6 SolOpenAI
10-1
11 benchmarks
Gemini 3.1 ProGoogle
Gemini 3.1 ProGoogle
10-1
11 benchmarks
Kimi K2.5Moonshot AI
Gemini 3.1 ProGoogle
8-3
11 benchmarks
Kimi K2.6Moonshot AI
Claude Opus 4.7Anthropic
9-2
11 benchmarks
Gemma 4 31BGoogle
Claude Opus 4.7Anthropic
7-4
11 benchmarks
DeepSeek V4 ProDeepSeek
Claude Opus 4.7Anthropic
11-0
11 benchmarks
Gemma 4 26B A4BGoogle
Claude Opus 4.6Anthropic
9-2
11 benchmarks
Kimi K2.5Moonshot AI
Claude Opus 4.6Anthropic
9-2
11 benchmarks
Gemma 4 31BGoogle
Claude Opus 4.6Anthropic
9-2
11 benchmarks
Gemma 4 26B A4BGoogle
Kimi K2.5Moonshot AI
9-2
11 benchmarks
Qwen 3.6 35B-A3BAlibaba
GPT-5.5OpenAI
8-1
10 benchmarks
Claude Opus 4.6Anthropic
GPT-5.5OpenAI
9-0
10 benchmarks
Kimi K2.6Moonshot AI
Claude Opus 4.8Anthropic
4-6
10 benchmarks
Gemini 3.1 ProGoogle
Claude Opus 4.8Anthropic
9-1
10 benchmarks
InklingThinking Machines Lab
GPT-5.6 SolOpenAI
8-2
10 benchmarks
Claude Opus 4.7Anthropic
Gemini 3.1 ProGoogle
1-9
10 benchmarks
Claude Fable 5Anthropic
Gemini 3.1 ProGoogle
10-0
10 benchmarks
Qwen3.5 27BAlibaba
Gemini 3.1 ProGoogle
10-0
10 benchmarks
Gemma 4 31BGoogle
Gemini 3.1 ProGoogle
10-0
10 benchmarks
Gemma 4 26B A4BGoogle
Gemini 3.1 ProGoogle
9-1
10 benchmarks
InklingThinking Machines Lab
Claude Opus 4.7Anthropic
9-1
10 benchmarks
Qwen 3.6 35B-A3BAlibaba
Claude Opus 4.6Anthropic
6-4
10 benchmarks
DeepSeek V4 ProDeepSeek
Claude Opus 4.6Anthropic
6-4
10 benchmarks
Kimi K2.6Moonshot AI
Claude Opus 4.6Anthropic
7-3
10 benchmarks
Qwen 3.6 35B-A3BAlibaba
Kimi K2.5Moonshot AI
9-1
10 benchmarks
Qwen3.5 27BAlibaba
Kimi K2.5Moonshot AI
10-0
10 benchmarks
Gemma 4 31BGoogle
Kimi K2.5Moonshot AI
0-10
10 benchmarks
Kimi K2.6Moonshot AI
Kimi K2.5Moonshot AI
10-0
10 benchmarks
Gemma 4 26B A4BGoogle
Gemma 4 31BGoogle
1-8
10 benchmarks
Qwen 3.6 35B-A3BAlibaba
Kimi K2.6Moonshot AI
10-0
10 benchmarks
Qwen 3.6 27BAlibaba
Gemma 4 26B A4BGoogle
0-10
10 benchmarks
Qwen 3.6 35B-A3BAlibaba
GPT-5.5OpenAI
8-1
9 benchmarks
DeepSeek V4 ProDeepSeek
GPT-5.5OpenAI
9-0
9 benchmarks
InklingThinking Machines Lab
Claude Opus 4.8Anthropic
6-3
9 benchmarks
Claude Opus 4.7Anthropic
Claude Opus 4.8Anthropic
7-2
9 benchmarks
Kimi K2.6Moonshot AI
GPT-5.6 SolOpenAI
9-0
9 benchmarks
InklingThinking Machines Lab
Gemini 3.1 ProGoogle
7-1
9 benchmarks
DeepSeek V4 ProDeepSeek
Gemini 3.1 ProGoogle
9-0
9 benchmarks
Qwen 3.6 27BAlibaba
Gemini 3.1 ProGoogle
9-0
9 benchmarks
Qwen 3.6 35B-A3BAlibaba
Claude Fable 5Anthropic
8-1
9 benchmarks
Claude Opus 4.7Anthropic
Claude Fable 5Anthropic
9-0
9 benchmarks
InklingThinking Machines Lab
Claude Opus 4.7Anthropic
9-0
9 benchmarks
InklingThinking Machines Lab
Claude Opus 4.7Anthropic
8-1
9 benchmarks
Qwen 3.6 27BAlibaba
GPT-5.4OpenAI
9-0
9 benchmarks
Kimi K2.5Moonshot AI
Claude Opus 4.6Anthropic
6-3
9 benchmarks
Qwen 3.6 27BAlibaba
Kimi K2.5Moonshot AI
0-9
9 benchmarks
DeepSeek V4 ProDeepSeek
Kimi K2.5Moonshot AI
5-4
9 benchmarks
Qwen 3.6 27BAlibaba
Gemma 4 31BGoogle
0-9
9 benchmarks
DeepSeek V4 ProDeepSeek
Gemma 4 31BGoogle
1-8
9 benchmarks
Qwen 3.6 27BAlibaba
DeepSeek V4 ProDeepSeek
9-0
9 benchmarks
Gemma 4 26B A4BGoogle
Kimi K2.6Moonshot AI
8-1
9 benchmarks
InklingThinking Machines Lab
Kimi K2.6Moonshot AI
9-0
9 benchmarks
Qwen 3.6 35B-A3BAlibaba
Gemma 4 26B A4BGoogle
0-9
9 benchmarks
Qwen 3.6 27BAlibaba
GPT-5.5OpenAI
8-0
8 benchmarks
Kimi K2.5Moonshot AI
GPT-5.5OpenAI
8-0
8 benchmarks
Gemma 4 31BGoogle
GPT-5.5OpenAI
8-0
8 benchmarks
Gemma 4 26B A4BGoogle
Claude Opus 4.8Anthropic
8-0
8 benchmarks
DeepSeek V4 ProDeepSeek
GPT-5.6 SolOpenAI
8-0
8 benchmarks
GPT-5.4OpenAI
GPT-5.6 SolOpenAI
8-0
8 benchmarks
Kimi K2.6Moonshot AI
Gemini 3.1 ProGoogle
2-6
8 benchmarks
Kimi K3Moonshot AI
Gemini 3.1 ProGoogle
4-4
8 benchmarks
GLM-5.2Z.ai
Kimi K3Moonshot AI
8-0
8 benchmarks
InklingThinking Machines Lab
Claude Opus 4.7Anthropic
8-0
8 benchmarks
Qwen3.5 27BAlibaba
GLM-5.2Z.ai
4-4
8 benchmarks
DeepSeek V4 ProDeepSeek
GLM-5.2Z.ai
8-0
8 benchmarks
InklingThinking Machines Lab
GPT-5.4OpenAI
5-3
8 benchmarks
Kimi K2.6Moonshot AI
Claude Opus 4.6Anthropic
6-2
8 benchmarks
Qwen3.5 27BAlibaba
EXAONE 4.5 33BLG AI Research
2-6
8 benchmarks
Qwen3.5 27BAlibaba
EXAONE 4.5 33BLG AI Research
1-7
8 benchmarks
Qwen 3.6 35B-A3BAlibaba
Gemma 4 31BGoogle
0-8
8 benchmarks
Kimi K2.6Moonshot AI
DeepSeek V4 ProDeepSeek
8-0
8 benchmarks
Qwen 3.6 35B-A3BAlibaba
Kimi K2.6Moonshot AI
8-0
8 benchmarks
Gemma 4 26B A4BGoogle