benchmark
.
space
benchmarks
rankings
compare
voices
transcripts
papers
articles
Agents' Last Exam leaderboard
Agents' Last Exam
9 models tested · Updated 2026-07-09 · Verified sources only
GPT-5.6 Sol
leads at
52.7%
1
GPT-5.6 Sol
OpenAI ·
Blog/OpenAI
· 2026-07-09
Beats Terra (50.4) and Luna (50.3). Agents' Last Exam is agentic QA.
52.7%
2
GPT-5.6 Terra
OpenAI ·
Blog/OpenAI
· 2026-07-09
Mid-tier GPT-5.6 variant on Agents' Last Exam.
50.4%
3
GPT-5.6 Luna
OpenAI ·
Blog/OpenAI
· 2026-07-09
Smallest GPT-5.6 variant. Near Terra (50.4).
50.3%
4
GPT-5.5 Pro
OpenAI ·
Blog/OpenAI
· 2026-04-23
OpenAI official. Pro variant beats GPT-5.5 base (46.9).
48.3%
5
GPT-5.5
OpenAI ·
Blog/OpenAI
· 2026-04-23
OpenAI official. Beats Gemini 3.1 Pro (32.1) significantly.
46.9%
6
Claude Opus 4.8
Anthropic ·
Blog/OpenAI (cross-ref)
· 2026-07-09
OpenAI's measurement. Beats GPT-5.5 (41.4).
45.2%
7
GPT-5.4
OpenAI ·
Blog/OpenAI
· 2026-04-23
OpenAI official. GPT-5.5 scores 46.9.
44.7%
8
Claude Fable 5
Anthropic ·
Blog/OpenAI (cross-ref)
· 2026-07-09
OpenAI's measurement. Beats Gemini 3.1 Pro (32.1).
40.5%
9
Gemini 3.1 Pro Preview
Google DeepMind ·
Blog/OpenAI (cross-ref)
· 2026-07-09
OpenAI's measurement. Far behind GPT-5.6 Sol (52.7).
32.1%