Who's winning
Composite score: average rank percentile across benchmarks + breadth bonus. Models with 3+ benchmarks. Higher = consistently ranks near the top across more benchmarks.
1
Anthropic · 6 benchmarks
92.1
2
Anthropic · 13 benchmarks
91.9
3
OpenAI · 3 benchmarks
90.6
4
OpenAI · 9 benchmarks
86.8
5
Anthropic · 30 benchmarks
86.2
6
Alibaba · 9 benchmarks
84.8
7
Moonshot AI · 28 benchmarks
84.1
8
OpenAI · 7 benchmarks
82.0
9
PrismML · 8 benchmarks
80.5
10
Alibaba · 8 benchmarks
77.9
11
OpenAI · 8 benchmarks
77.3
12
H Company · 4 benchmarks
77.0
13
arxiv · 5 benchmarks
75.8
14
Alibaba · 10 benchmarks
74.8
15
Google · 5 benchmarks
74.7
16
DeepSeek · 3 benchmarks
73.5
17
ByteDance · 6 benchmarks
73.2
18
OpenAI · 35 benchmarks
72.2
19
Moonshot AI · 15 benchmarks
71.7
20
OpenAI · 6 benchmarks
71.3
21
DeepSeek · 7 benchmarks
68.9
22
Anthropic · 28 benchmarks
68.9
23
OpenAI · 9 benchmarks
68.5
24
OpenAI · 6 benchmarks
68.4
25
Zhipu AI · 5 benchmarks
67.7
26
Research · 6 benchmarks
67.6
27
DeepSeek · 16 benchmarks
67.3
28
Google · 30 benchmarks
67.2
29
Arcee AI · 6 benchmarks
67.2
30
Google DeepMind · 11 benchmarks
67.0