FrontierSWE
8 models tested · Updated 2026-06-09 · Verified sources only
Claude Fable 5 leads at 86.6%
1
Anthropic · Blog/Anthropic · 2026-06-09
Score as cited in Kimi K3 blog (source: Anthropic official). Fable 5 hit fallbacks on 35% of tasks.
86.6%
2
Moonshot AI · Blog/Moonshot AI · 2026-07-16
KimiCode harness. Trails Fable 5 (86.6) but beats GPT-5.6 Sol (71.3) and Opus 4.8 (66.7).
81.2%
3
Anthropic · Blog/Z.ai · 2026-06-13
#1 on FrontierSWE. GLM-5.2 trails by 1 point.
75.1%
4
Z.ai · Blog/Z.ai · 2026-06-13
Trails Opus 4.8 by 1 point, edges GPT-5.5 by 1%. Evaluated by Proximal.ai with 1M context.
74.4%
5
OpenAI · Blog/OpenAI · 2026-07-09
Score as cited in Kimi K3 blog (source: OpenAI official).
71.3%
6
Z.ai · Blog/Z.ai · 2026-06-13
Score as cited in Kimi K3 blog (source: Z.ai official).
67.3%
7
Anthropic · Blog/Anthropic · 2026-06-17
Score as cited in Kimi K3 blog (source: Anthropic official).
66.7%
8
OpenAI · Blog/OpenAI · 2026-06-26
Score as cited in Kimi K3 blog (source: OpenAI official).
64.9%