Toolathlon-Verified
7 models tested · Updated 2026-06-09 · Verified sources only
Claude Fable 5 leads at 77.9%
1
Anthropic · Blog/Anthropic · 2026-06-09
Score as cited in Kimi K3 blog (source: Anthropic official). Fable 5 hit fallbacks on 35% of tasks.
77.9%
2
Anthropic · Blog/Anthropic · 2026-06-17
Score as cited in Kimi K3 blog (source: Anthropic official).
76.2%
3
OpenAI · Blog/OpenAI · 2026-07-09
Score as cited in Kimi K3 blog (source: OpenAI official).
74.9%
4
OpenAI · Blog/OpenAI · 2026-06-26
Score as cited in Kimi K3 blog (source: OpenAI official).
73.5%
5
Moonshot AI · Blog/Moonshot AI · 2026-07-16
73.2%
6
Z.ai · Blog/Z.ai · 2026-06-13
Score as cited in Kimi K3 blog (source: Z.ai official).
59.9%
7
Thinking Machines Lab · Blog/Thinking Machines Lab · 2026-07-20
Agentic tool use; below GLM-5.2 (59.9) and Fable 5 (76.4). Open-weights base.
45.5%