OSWorld 2.0 Results Across LLMs
Vendor-reported OSWorld 2.0 results across showcased LLMs. Computer-use / desktop agent: operate a real GUI environment to complete open-ended tasks (partial scores must be noted).
What this table contains
Computer-use / desktop agent: operate a real GUI environment to complete open-ended tasks (partial scores must be noted).
14 models with results · 16 missing · 30 showcased models. Missing scores are not zero or failed tests. Headline selection is the default; source dates and setups can differ.
Interactive results & effort preference → · Results over time → · Methodology
| Model | Headline score | Source/record date | Evidence |
|---|---|---|---|
| Claude Opus 5.5Anthropic | 81.8%max effort | 2026-09-22 | All 1 recorded result & sources81.8% · raw 81.8 % Headline · max effort · Own vendor Source/record date: 2026-09-22 OSWorld 2.0 partial score as reported https://www.anthropic.com/claude-opus-5-5 |
| Claude Sonnet 5.5Anthropic | 80.1%max effort | 2026-09-28 | All 1 recorded result & sources80.1% · raw 80.1 % Headline · max effort · Own vendor Source/record date: 2026-09-28 OSWorld 2.1 partial-credit at max (stored under osworld-2.0 per project convention); strict pass rate 43.5 percent https://www.anthropic.com/claude-sonnet-5-5 |
| Claude Fable 5.1Anthropic | 77.9%unknown effort | — | All 2 recorded results & sources80.7% · raw 80.7 % Alternative · unknown effort · Peer vendor Source/record date: 2026-09-22 OSWorld 2.0 partial; as reported by Anthropic Opus 5.5 announce; demoted as headline after Fable own-page figure harvest https://www.anthropic.com/claude-opus-5-577.9% · raw 77.9 % Headline · unknown effort · Own vendor Source/record date: Not recorded from chart/figure Anthropic Fable page; OSWorld 2.0 partial (strict 41.7% also shown) https://www.anthropic.com/claude/fable |
| GPT-6 AstraOpenAI | 72.6%unknown effort | 2026-09-03 | All 2 recorded results & sources72.6% · raw 72.6 % Headline · unknown effort · Own vendor Source/record date: 2026-09-03 v2026.08.08 offline set, partial score; ~40 min/task https://openai.com/index/gpt-6-astra/72.6% · raw 72.6 % Alternative · unknown effort · Peer vendor Source/record date: 2026-09-30 As reported by Google Gemini 4 Argon chart; peer harness notes in Google eval methodology | Same value as current headline; kept as corroboration, non-headline. https://storage.googleapis.com/gweb-uniblog-publish-prod/original_images/gemini-4-argon_table_blog.gif |
| GPT-6.1 SolOpenAI | 71.4%max effort | 2026-09-29 | All 1 recorded result & sources71.4% · raw 71.4 % Headline · max effort · Own vendor Source/record date: 2026-09-29 Offline set partial reward v2026.08.08; +7.0 over GPT-6 Sol at less than half cost; -2.1 vs Astra at ~1/7 cost/task https://openai.com/index/introducing-gpt-6-1-sol/ |
| Gemini 4 ArgonGoogle | 69.2%max effort | 2026-09-30 | All 1 recorded result & sources69.2% · raw 69.2 % Headline · max effort · Own vendor Source/record date: 2026-09-30 Self-computed, offline subset partial score, max of 3 runs, Gemini CUA harness | Highest thinking settings per Google eval methodology. https://storage.googleapis.com/gweb-uniblog-publish-prod/original_images/gemini-4-argon_table_blog.gif |
| Muse Spark 1.3Meta | 66.9%max effort | — | All 1 recorded result & sources66.9% · raw 66.9 % Headline · max effort · Own vendor Source/record date: Not recorded from chart/figure Meta Muse Spark 1.3 scorecard; OSWorld 2.0 partial; max effort https://research.meta.ai/blog/introducing-muse-spark-1-3 |
| GLM-5.3-FlashZ.ai | 59.1%unknown effort | 2026-08-26 | All 1 recorded result & sources59.1% · raw 59.1 % Headline · unknown effort · Own vendor Source/record date: 2026-08-26 OSWorld 2.0 https://z.ai/blog/glm-5.3-flash |
| Gemini 3.8 FlashGoogle | 59%unknown effort | 2026-09-03 | All 1 recorded result & sources59% · raw 59 % Headline · unknown effort · Own vendor Source/record date: 2026-09-03 Partial score; batch tool enabled https://deepmind.google/models/model-cards/gemini-3-8-flash |
| Kimi K3Moonshot AI | 58.3%max effort | 2026-07-16 | All 1 recorded result & sources58.3% · raw 58.3 % Headline · max effort · Own vendor Source/record date: 2026-07-16 OSWorld 2.0 https://github.com/MoonshotAI/Kimi-K3 |
| Nex-N2.5-ProNex AGI | 56.4%unknown effort | 2026-09-08 | All 1 recorded result & sources56.4% · raw 56.4 % Headline · unknown effort · Own vendor Source/record date: 2026-09-08 OSWorld-2; NexCUA https://huggingface.co/nex-agi/Nex-N2.5-Pro |
| Qwen3.8 FlashAlibaba (Qwen) | 52.3%unknown effort | 2026-08-26 | All 1 recorded result & sources52.3% · raw 52.3 % Headline · unknown effort · Own vendor Source/record date: 2026-08-26 OSWorld 2.0 partial reward from Qwen3.8-Flash-Next blog (binary 19.4 also listed) https://qwen.ai/blog?id=qwen3.8-flash-next |
| GPT-5.6 TerraOpenAI | 50.2%unknown effort | 2026-07-09 | All 1 recorded result & sources50.2% · raw 50.2 % Headline · unknown effort · Own vendor Source/record date: 2026-07-09 https://openai.com/index/gpt-5-6 |
| Qwen3.8 Max (0902)Alibaba (Qwen) | 46.7%unknown effort | 2026-09-08 | All 1 recorded result & sources46.7% · raw 46.7 % Headline · unknown effort · Peer vendor Source/record date: 2026-09-08 As reported in Nex-N2.5-Pro model card comparison table https://huggingface.co/nex-agi/Nex-N2.5-Pro |
| DeepSeek V4.1 FlashDeepSeek | — | — | No recorded result |
| GLM-5.3Z.ai | — | — | No recorded result |
| GPT-6 LunaOpenAI | — | — | No recorded result |
| Grok 4.7xAI | — | — | No recorded result |
| Hy4 previewTencent | — | — | No recorded result |
| Kolibri-1Aleph Alpha | — | — | No recorded result |
| Ling 3.0 Flash VLinclusionAI | — | — | No recorded result |
| Ling 3.1 FlashinclusionAI | — | — | No recorded result |
| Mercury 2.5Inception | — | — | No recorded result |
| MiMo-V2.6-Distill-Qwen-9BXiaomi | — | — | No recorded result |
| MiMo-V2.6-FlashXiaomi | — | — | No recorded result |
| MiMo-V2.6-ProXiaomi | — | — | No recorded result |
| Naive-N0.5-FlashNaiveAI | — | — | No recorded result |
| Pareto 26.10 PreviewUnbiased | — | — | No recorded result |
| Qwen3.8 27BAlibaba (Qwen) | — | — | No recorded result |
| Qwen3.8 Omni FlashAlibaba (Qwen) | — | — | No recorded result |
Benchmark source references
- OSWorld project · first_party
- OSWorld paper / leaderboard · paper
- OpenAI GPT-6 Astra system card · vendor_system_card
Use the fair-comparison guide before interpreting results from different configurations.