OSWorld 2.0
10 models tested · Updated 2026-07-09 · Verified sources only
GPT-5.6 Sol leads at 62.6%
1
OpenAI · Blog/OpenAI · 2026-07-09
OSWorld 2.0 partial-score SOTA, beating Opus 4.8 (54.8%) with 85% fewer output tokens.
62.6%
2
Anthropic · Blog/OSWorld 2.0 · 2026-06-26
Top of official OSWorld 2.0 leaderboard at launch (Jun 26). Only 20.6% binary completion — long-horizon tasks remain very hard. Paper: arxiv 2606.29537.
54.8%
3
OpenAI · Blog/OpenAI · 2026-07-09
Terra edges GPT-5.5 (47.5%) on OSWorld 2.0.
50.2%
4
OpenAI · Blog/OSWorld 2.0 · 2026-06-26
Official OSWorld 2.0 leaderboard (evaluated by benchmark team). Most token-efficient agent: 13% binary at 39K tokens vs Opus 4.8's 244K.
49.5%
5
Anthropic · Blog/OSWorld 2.0 · 2026-06-26
Official OSWorld 2.0 leaderboard. Max reasoning, batched tool calls, step=500.
48.9%
6
OpenAI · Blog/OpenAI · 2026-07-09
Luna trails GPT-5.5 (47.5%) slightly on OSWorld 2.0.
45.6%
7
Anthropic · Blog/OSWorld 2.0 · 2026-06-26
Official OSWorld 2.0 leaderboard. Max reasoning, step=500.
41.5%
8
MiniMax · Blog/OSWorld 2.0 · 2026-06-26
Official OSWorld 2.0 leaderboard. Lowest-cost agent on the board ($259 vs $3870 for Opus 4.7).
22.3%
9
Moonshot AI · Blog/OSWorld 2.0 · 2026-06-26
Official OSWorld 2.0 leaderboard. Enabled reasoning, step=500.
22.1%
10
Alibaba · Blog/OSWorld 2.0 · 2026-06-26
Official OSWorld 2.0 leaderboard. Thinking mode, step=500. Bottom of current leaderboard.
21.5%