benchmark
.
space
benchmarks
rankings
compare
voices
transcripts
papers
articles
Terminal-Bench 2.1 leaderboard
Terminal-Bench 2.1
27 models tested · Updated 2026-07-09 · Verified sources only
GPT-5.6 Sol Ultra
leads at
91.9%
1
GPT-5.6 Sol Ultra
OpenAI ·
Blog/OpenAI
· 2026-07-09
Ultra mode (4 parallel agents) sets Terminal-Bench 2.1 SOTA.
91.9%
2
GPT-5.6 Sol
OpenAI ·
Blog/OpenAI
· 2026-07-09
Edges Claude Mythos 5 (88.0%); Ultra mode hits 91.9%.
88.8%
3
Kimi K3
Moonshot AI ·
Blog/Moonshot AI
· 2026-07-16
KimiCode harness.
88.3%
4
Claude Fable 5
Anthropic ·
Blog/Anthropic
· 2026-06-09
Safeguard-affected score (~Mythos 5). Terminal-Bench 2.1, not 2.0.
88.0%
5
Claude Mythos 5
Anthropic ·
Blog/OpenAI
· 2026-06-09
Matches GPT-5.6 Sol (88.8) on Terminal-Bench 2.1; Mythos 5 is the unsafeguarded twin of Fable 5 (83.1).
88.0%
6
GPT-5.6 Terra
OpenAI ·
Blog/OpenAI
· 2026-07-09
Terra beats GPT-5.5 (85.6%) on Terminal-Bench 2.1.
87.4%
7
Claude Opus 4.8
Anthropic ·
Blog/Z.ai
· 2026-06-13
Beaten only by Fable 5 (88.0). Top open/commercial.
85.0%
8
GPT-5.6 Luna
OpenAI ·
Blog/OpenAI
· 2026-07-09
Luna near-parity with GPT-5.5 (85.6%) at lowest cost.
84.7%
9
Claude Fable 5
Anthropic ·
Blog/Anthropic
· 2026-06-09
Score as cited in Kimi K3 blog (source: Anthropic official). Fable 5 hit fallbacks on 35% of tasks.
84.6%
10
Claude Opus 4.8
Anthropic ·
Blog/Anthropic
· 2026-06-17
Score as cited in Kimi K3 blog (source: Anthropic official).
84.6%
11
GPT-5.5
OpenAI ·
Blog/OpenAI
· 2026-06-26
Score as cited in Kimi K3 blog (source: OpenAI official).
83.4%
12
Grok 4.5
xAI ·
Blog/xAI
· 2026-07-08
Within 1 point of Fable 5 (max) and GPT-5.5 (xhigh) at 84.3/83.4. First xAI model trained specifically for coding/agent tasks, 500K context.
83.3%
13
GLM-5.2
Z.ai ·
Blog/Z.ai
· 2026-06-13
Score as cited in Kimi K3 blog (source: Z.ai official).
82.7%
14
GLM-5.2
Z.ai ·
Blog/Z.ai
· 2026-06-13
Strongest open-source model. Terminus-2 harness. Up from GLM-5.1 (63.5).
81.0%
15
Gemini 3.5 Flash
Google DeepMind ·
Blog/Google DeepMind
· 2026-06-10
Terminus-2 harness. Below GPT-5.5 (78.2). Up from Gemini 3 Flash (58.0).
76.2%
16
Qwen3.7-Max
Alibaba ·
Blog/Z.ai
· 2026-06-13
Below GLM-5.2 (81.0) and Gemini 3.1 Pro (74).
75.0%
17
Kimi K2.6
Moonshot AI ·
Blog/ThinkingMachines
· 2026-07-15
From TML Inkling blog comparison table.
71.3%
18
Gemini 3.1 Pro
Google DeepMind ·
Blog/Google DeepMind
· 2026-06-10
Terminus-2. Below Gemini 3.5 Flash (76.2).
70.3%
19
Claude Opus 4.7
Anthropic ·
Blog/Google DeepMind
· 2026-06-10
Terminus-2. Lower than Gemini 3.5 Flash (76.2).
66.1%
20
MiniMax M3
MiniMax ·
Blog/MiniMax
· 2026-06-01
Official score 66.0 (Terminus-2). Internal infra, 8C16G sandbox, 2hr timeout.
66.0%
21
MiniMax M3
MiniMax ·
Blog/Z.ai
· 2026-06-13
Below GLM-5.2 (81.0). Open-weight 1M context model.
65.0%
22
Inkling
Thinking Machines Lab ·
Blog/Thinking Machines Lab
· 2026-07-20
Uses internal coding harness. Below GLM-5.2 (82.7) but above Nemotron 3 Ultra (56.4).
63.8%
23
DeepSeek V4 Flash
DeepSeek ·
Blog/StepFun-Step-3.7-Flash
· 2026-05-29
Terminal-Bench 2.1 score from StepFun internal testing.
62.0%
24
Step 3.7 Flash
StepFun ·
Blog/StepFun
· 2026-05-29
Terminal-Bench 2.1. +6.1 over Step 3.5 Flash.
59.6%
25
Gemini 3 Flash
Google DeepMind ·
Blog/Google DeepMind
· 2026-06-10
Terminus-2. Below Gemini 3.5 Flash (76.2).
58.0%
26
Nemotron 3 Ultra
NVIDIA ·
Blog/ThinkingMachines
· 2026-07-15
From TML Inkling blog.
56.4%
27
Inkling-Small
Thinking Machines Lab ·
Blog/ThinkingMachines
· 2026-07-15
Lower than Inkling (63.8) on Terminal-Bench.
52.7%