APEX-Agents
7 models tested · Updated 2026-06-09 · Verified sources only
Claude Fable 5 leads at 43.3%
1
Anthropic · Blog/Anthropic · 2026-06-09
Score as cited in Kimi K3 blog (source: Anthropic official). Fable 5 hit fallbacks on 35% of tasks.
43.3%
2
Moonshot AI · Blog/Moonshot AI · 2026-07-16
41.0%
3
OpenAI · Blog/OpenAI · 2026-07-09
Score as cited in Kimi K3 blog (source: OpenAI official).
39.9%
4
Anthropic · Blog/Anthropic · 2026-06-17
Score as cited in Kimi K3 blog (source: Anthropic official).
39.4%
5
OpenAI · Blog/OpenAI · 2026-06-26
Score as cited in Kimi K3 blog (source: OpenAI official).
38.5%
6
DeepSeek · HuggingFace/deepseek-ai-DeepSeek-V4-Pro · 2026-04-24
Apex (Pass@1). Competitive agent benchmark.
38.3%
7
Z.ai · Blog/Z.ai · 2026-06-13
Score as cited in Kimi K3 blog (source: Z.ai official).
35.6%