benchmark
.
space
benchmarks
rankings
compare
voices
transcripts
papers
articles
MCP-Atlas leaderboard
MCP-Atlas
17 models tested · Updated 2026-06-09 · Verified sources only
Claude Fable 5
leads at
84.7%
1
Claude Fable 5
Anthropic ·
Blog/Anthropic
· 2026-06-09
Score as cited in Kimi K3 blog (source: Anthropic official). Fable 5 hit fallbacks on 35% of tasks.
84.7%
2
Kimi K3
Moonshot AI ·
Blog/Moonshot AI
· 2026-07-16
500-task public subset, 100-turn limit, Gemini 3.1 Pro judge.
84.2%
3
Gemini 3.5 Flash
Google DeepMind ·
Blog/Google DeepMind
· 2026-06-10
Highest among compared models. Up from Gemini 3 Flash (62.0).
83.6%
4
GPT-5.6 Sol
OpenAI ·
Blog/OpenAI
· 2026-07-09
Score as cited in Kimi K3 blog (source: OpenAI official).
83.6%
5
Claude Opus 4.8
Anthropic ·
Blog/Anthropic
· 2026-06-17
Score as cited in Kimi K3 blog (source: Anthropic official).
83.6%
6
GPT-5.5
OpenAI ·
Blog/OpenAI
· 2026-06-26
Score as cited in Kimi K3 blog (source: OpenAI official).
82.8%
7
GLM-5.2
Z.ai ·
Blog/Z.ai
· 2026-06-13
Score as cited in Kimi K3 blog (source: Z.ai official).
82.6%
8
Claude Opus 4.7
Anthropic ·
Blog/Google DeepMind
· 2026-06-10
Below Gemini 3.5 Flash (83.6) and Gemini 3.1 Pro (78.2).
79.1%
9
Gemini 3.1 Pro
Google DeepMind ·
Blog/Google DeepMind
· 2026-06-10
Below Gemini 3.5 Flash (83.6).
78.2%
10
Claude Opus 4.8
Anthropic ·
Blog/Z.ai
· 2026-06-13
Highest among compared models.
77.8%
11
GLM-5.2
Z.ai ·
Blog/Z.ai
· 2026-06-13
Public set. Up from GLM-5.1 (71.8). MCP tool-use benchmark.
76.8%
12
Inkling-Small
Thinking Machines Lab ·
Blog/ThinkingMachines
· 2026-07-15
Beats Inkling slightly on MCP-Atlas.
74.9%
13
MiniMax M3
MiniMax ·
Blog/Z.ai
· 2026-06-13
Below GLM-5.2 (76.8). Agentic tool use.
74.2%
14
Inkling
Thinking Machines Lab ·
Blog/Thinking Machines Lab
· 2026-07-20
MCP tool-use; above Nemotron 3 Ultra (44.7) and Kimi K2.5 (64.0). Strong agentic foundation.
74.1%
15
DeepSeek V4 Pro
DeepSeek ·
HuggingFace/deepseek-ai-DeepSeek-V4-Pro
· 2026-04-24
Pass@1. MCP-Atlas public eval.
73.6%
16
Claude Sonnet 4.6
Anthropic ·
Blog/Google DeepMind
· 2026-06-10
Below Gemini 3.5 Flash (83.6) and Opus 4.7 (79.1).
69.5%
17
Gemini 3 Flash
Google DeepMind ·
Blog/Google DeepMind
· 2026-06-10
Below Gemini 3.5 Flash (83.6). Big jump for new Flash.
62.0%