Agents' Last Exam
9 models tested · Updated 2026-07-09 · Verified sources only
GPT-5.6 Sol leads at 52.7%
1
OpenAI · Blog/OpenAI · 2026-07-09
Beats Terra (50.4) and Luna (50.3). Agents' Last Exam is agentic QA.
52.7%
2
OpenAI · Blog/OpenAI · 2026-07-09
Mid-tier GPT-5.6 variant on Agents' Last Exam.
50.4%
3
OpenAI · Blog/OpenAI · 2026-07-09
Smallest GPT-5.6 variant. Near Terra (50.4).
50.3%
4
OpenAI · Blog/OpenAI · 2026-04-23
OpenAI official. Pro variant beats GPT-5.5 base (46.9).
48.3%
5
OpenAI · Blog/OpenAI · 2026-04-23
OpenAI official. Beats Gemini 3.1 Pro (32.1) significantly.
46.9%
6
Anthropic · Blog/OpenAI (cross-ref) · 2026-07-09
OpenAI's measurement. Beats GPT-5.5 (41.4).
45.2%
7
OpenAI · Blog/OpenAI · 2026-04-23
OpenAI official. GPT-5.5 scores 46.9.
44.7%
8
Anthropic · Blog/OpenAI (cross-ref) · 2026-07-09
OpenAI's measurement. Beats Gemini 3.1 Pro (32.1).
40.5%
9
Google DeepMind · Blog/OpenAI (cross-ref) · 2026-07-09
OpenAI's measurement. Far behind GPT-5.6 Sol (52.7).
32.1%