SWE Marathon
6 models tested · Updated 2026-07-16 · Verified sources only
Kimi K3 leads at 42.0%
1
Moonshot AI · Blog/Moonshot AI · 2026-07-16
KimiCode harness. H20-calibrated v1.1 tasks.
42.0%
2
Anthropic · Blog/Anthropic · 2026-06-17
Score as cited in Kimi K3 blog (source: Anthropic official).
40.0%
3
OpenAI · Blog/OpenAI · 2026-07-09
Score as cited in Kimi K3 blog (source: OpenAI official).
39.0%
4
Anthropic · Blog/Anthropic · 2026-06-09
Score as cited in Kimi K3 blog (source: Anthropic official). Fable 5 hit fallbacks on 35% of tasks.
35.0%
5
OpenAI · Blog/OpenAI · 2026-06-26
Score as cited in Kimi K3 blog (source: OpenAI official).
14.0%
6
Z.ai · Blog/Z.ai · 2026-06-13
Score as cited in Kimi K3 blog (source: Z.ai official).
13.0%