benchmark
.
space
benchmarks
rankings
compare
voices
transcripts
papers
articles
SpreadsheetBench 2 leaderboard
SpreadsheetBench 2
6 models tested · Updated 2026-07-16 · Verified sources only
Kimi K3
leads at
34.8%
1
Kimi K3
Moonshot AI ·
Blog/Moonshot AI
· 2026-07-16
34.8%
2
Claude Fable 5
Anthropic ·
Blog/Anthropic
· 2026-06-09
Score as cited in Kimi K3 blog (source: Anthropic official). Fable 5 hit fallbacks on 35% of tasks.
34.7%
3
GPT-5.6 Sol
OpenAI ·
Blog/OpenAI
· 2026-07-09
Score as cited in Kimi K3 blog (source: OpenAI official).
32.4%
4
Claude Opus 4.8
Anthropic ·
Blog/Anthropic
· 2026-06-17
Score as cited in Kimi K3 blog (source: Anthropic official).
31.55%
5
GPT-5.5
OpenAI ·
Blog/OpenAI
· 2026-06-26
Score as cited in Kimi K3 blog (source: OpenAI official).
29.05%
6
GLM-5.2
Z.ai ·
Blog/Z.ai
· 2026-06-13
Score as cited in Kimi K3 blog (source: Z.ai official).
28.12%