Examenos

OSWorld 2.0 Results Across LLMs

Vendor-reported OSWorld 2.0 results across showcased LLMs. Computer-use / desktop agent: operate a real GUI environment to complete open-ended tasks (partial scores must be noted).

Official / vendor Higher is better · unit: %

What this table contains

Computer-use / desktop agent: operate a real GUI environment to complete open-ended tasks (partial scores must be noted).

14 models with results · 16 missing · 30 showcased models. Missing scores are not zero or failed tests. Headline selection is the default; source dates and setups can differ.

Interactive results & effort preference → · Results over time → · Methodology

OSWorld 2.0: vendor-reported results only
ModelHeadline scoreSource/record dateEvidence
Claude Opus 5.5Anthropic81.8%max effort2026-09-22
All 1 recorded result & sources

81.8% · raw 81.8 %

Headline · max effort · Own vendor

Source/record date: 2026-09-22

OSWorld 2.0 partial score as reported

https://www.anthropic.com/claude-opus-5-5
Claude Sonnet 5.5Anthropic80.1%max effort2026-09-28
All 1 recorded result & sources

80.1% · raw 80.1 %

Headline · max effort · Own vendor

Source/record date: 2026-09-28

OSWorld 2.1 partial-credit at max (stored under osworld-2.0 per project convention); strict pass rate 43.5 percent

https://www.anthropic.com/claude-sonnet-5-5
Claude Fable 5.1Anthropic77.9%unknown effort—
All 2 recorded results & sources

80.7% · raw 80.7 %

Alternative · unknown effort · Peer vendor

Source/record date: 2026-09-22

OSWorld 2.0 partial; as reported by Anthropic Opus 5.5 announce; demoted as headline after Fable own-page figure harvest

https://www.anthropic.com/claude-opus-5-5

77.9% · raw 77.9 %

Headline · unknown effort · Own vendor

Source/record date: Not recorded

from chart/figure Anthropic Fable page; OSWorld 2.0 partial (strict 41.7% also shown)

https://www.anthropic.com/claude/fable
GPT-6 AstraOpenAI72.6%unknown effort2026-09-03
All 2 recorded results & sources

72.6% · raw 72.6 %

Headline · unknown effort · Own vendor

Source/record date: 2026-09-03

v2026.08.08 offline set, partial score; ~40 min/task

https://openai.com/index/gpt-6-astra/

72.6% · raw 72.6 %

Alternative · unknown effort · Peer vendor

Source/record date: 2026-09-30

As reported by Google Gemini 4 Argon chart; peer harness notes in Google eval methodology | Same value as current headline; kept as corroboration, non-headline.

https://storage.googleapis.com/gweb-uniblog-publish-prod/original_images/gemini-4-argon_table_blog.gif
GPT-6.1 SolOpenAI71.4%max effort2026-09-29
All 1 recorded result & sources

71.4% · raw 71.4 %

Headline · max effort · Own vendor

Source/record date: 2026-09-29

Offline set partial reward v2026.08.08; +7.0 over GPT-6 Sol at less than half cost; -2.1 vs Astra at ~1/7 cost/task

https://openai.com/index/introducing-gpt-6-1-sol/
Gemini 4 ArgonGoogle69.2%max effort2026-09-30
All 1 recorded result & sources

69.2% · raw 69.2 %

Headline · max effort · Own vendor

Source/record date: 2026-09-30

Self-computed, offline subset partial score, max of 3 runs, Gemini CUA harness | Highest thinking settings per Google eval methodology.

https://storage.googleapis.com/gweb-uniblog-publish-prod/original_images/gemini-4-argon_table_blog.gif
Muse Spark 1.3Meta66.9%max effort—
All 1 recorded result & sources

66.9% · raw 66.9 %

Headline · max effort · Own vendor

Source/record date: Not recorded

from chart/figure Meta Muse Spark 1.3 scorecard; OSWorld 2.0 partial; max effort

https://research.meta.ai/blog/introducing-muse-spark-1-3
GLM-5.3-FlashZ.ai59.1%unknown effort2026-08-26
All 1 recorded result & sources

59.1% · raw 59.1 %

Headline · unknown effort · Own vendor

Source/record date: 2026-08-26

OSWorld 2.0

https://z.ai/blog/glm-5.3-flash
Gemini 3.8 FlashGoogle59%unknown effort2026-09-03
All 1 recorded result & sources

59% · raw 59 %

Headline · unknown effort · Own vendor

Source/record date: 2026-09-03

Partial score; batch tool enabled

https://deepmind.google/models/model-cards/gemini-3-8-flash
Kimi K3Moonshot AI58.3%max effort2026-07-16
All 1 recorded result & sources

58.3% · raw 58.3 %

Headline · max effort · Own vendor

Source/record date: 2026-07-16

OSWorld 2.0

https://github.com/MoonshotAI/Kimi-K3
Nex-N2.5-ProNex AGI56.4%unknown effort2026-09-08
All 1 recorded result & sources

56.4% · raw 56.4 %

Headline · unknown effort · Own vendor

Source/record date: 2026-09-08

OSWorld-2; NexCUA

https://huggingface.co/nex-agi/Nex-N2.5-Pro
Qwen3.8 FlashAlibaba (Qwen)52.3%unknown effort2026-08-26
All 1 recorded result & sources

52.3% · raw 52.3 %

Headline · unknown effort · Own vendor

Source/record date: 2026-08-26

OSWorld 2.0 partial reward from Qwen3.8-Flash-Next blog (binary 19.4 also listed)

https://qwen.ai/blog?id=qwen3.8-flash-next
GPT-5.6 TerraOpenAI50.2%unknown effort2026-07-09
All 1 recorded result & sources

50.2% · raw 50.2 %

Headline · unknown effort · Own vendor

Source/record date: 2026-07-09

https://openai.com/index/gpt-5-6
Qwen3.8 Max (0902)Alibaba (Qwen)46.7%unknown effort2026-09-08
All 1 recorded result & sources

46.7% · raw 46.7 %

Headline · unknown effort · Peer vendor

Source/record date: 2026-09-08

As reported in Nex-N2.5-Pro model card comparison table

https://huggingface.co/nex-agi/Nex-N2.5-Pro
DeepSeek V4.1 FlashDeepSeek——No recorded result
GLM-5.3Z.ai——No recorded result
GPT-6 LunaOpenAI——No recorded result
Grok 4.7xAI——No recorded result
Hy4 previewTencent——No recorded result
Kolibri-1Aleph Alpha——No recorded result
Ling 3.0 Flash VLinclusionAI——No recorded result
Ling 3.1 FlashinclusionAI——No recorded result
Mercury 2.5Inception——No recorded result
MiMo-V2.6-Distill-Qwen-9BXiaomi——No recorded result
MiMo-V2.6-FlashXiaomi——No recorded result
MiMo-V2.6-ProXiaomi——No recorded result
Naive-N0.5-FlashNaiveAI——No recorded result
Pareto 26.10 PreviewUnbiased——No recorded result
Qwen3.8 27BAlibaba (Qwen)——No recorded result
Qwen3.8 Omni FlashAlibaba (Qwen)——No recorded result

Benchmark source references

Use the fair-comparison guide before interpreting results from different configurations.