benchmark
.
space
benchmarks
rankings
compare
voices
transcripts
papers
articles
OSWorld 2.0 leaderboard
OSWorld 2.0
10 models tested · Updated 2026-07-09 · Verified sources only
GPT-5.6 Sol
leads at
62.6%
1
GPT-5.6 Sol
OpenAI ·
Blog/OpenAI
· 2026-07-09
OSWorld 2.0 partial-score SOTA, beating Opus 4.8 (54.8%) with 85% fewer output tokens.
62.6%
2
Claude Opus 4.8
Anthropic ·
Blog/OSWorld 2.0
· 2026-06-26
Top of official OSWorld 2.0 leaderboard at launch (Jun 26). Only 20.6% binary completion — long-horizon tasks remain very hard. Paper: arxiv 2606.29537.
54.8%
3
GPT-5.6 Terra
OpenAI ·
Blog/OpenAI
· 2026-07-09
Terra edges GPT-5.5 (47.5%) on OSWorld 2.0.
50.2%
4
GPT-5.5
OpenAI ·
Blog/OSWorld 2.0
· 2026-06-26
Official OSWorld 2.0 leaderboard (evaluated by benchmark team). Most token-efficient agent: 13% binary at 39K tokens vs Opus 4.8's 244K.
49.5%
5
Claude Opus 4.7
Anthropic ·
Blog/OSWorld 2.0
· 2026-06-26
Official OSWorld 2.0 leaderboard. Max reasoning, batched tool calls, step=500.
48.9%
6
GPT-5.6 Luna
OpenAI ·
Blog/OpenAI
· 2026-07-09
Luna trails GPT-5.5 (47.5%) slightly on OSWorld 2.0.
45.6%
7
Claude Sonnet 4.6
Anthropic ·
Blog/OSWorld 2.0
· 2026-06-26
Official OSWorld 2.0 leaderboard. Max reasoning, step=500.
41.5%
8
MiniMax M3
MiniMax ·
Blog/OSWorld 2.0
· 2026-06-26
Official OSWorld 2.0 leaderboard. Lowest-cost agent on the board ($259 vs $3870 for Opus 4.7).
22.3%
9
Kimi K2.6
Moonshot AI ·
Blog/OSWorld 2.0
· 2026-06-26
Official OSWorld 2.0 leaderboard. Enabled reasoning, step=500.
22.1%
10
Qwen 3.7-Plus
Alibaba ·
Blog/OSWorld 2.0
· 2026-06-26
Official OSWorld 2.0 leaderboard. Thinking mode, step=500. Bottom of current leaderboard.
21.5%