Examenos

Mercury 2.5 Benchmarks, Specifications & Availability

Explore Mercury 2.5 from Inception: published specifications, source-linked vendor benchmarks, independent evaluator coverage and recorded pricing when available.

Compare Mercury 2.5 with other models →Explore data coverage

Published specifications

Provider
Inception
Access
Proprietary
License
Proprietary
Context window
260K
Total parameters
Not published
Active parameters
Not published
Released
2026-09-08
Modalities
text
Family
Mercury

Announcement · Website · OpenRouter

Model notes

Diffusion LLM (dLLM); tunable reasoning, parallel tool calls, JSON mode. Official quality numbers harvested from results figure on release post (2026-09-23 figure harvest).

Pricing · OpenRouter

Dated cached OpenRouter rates in USD per 1M tokens. Open the dashboard for live enhancements. Per-metric endpoint minima can refer to different providers; they are not a guaranteed combined rate from one endpoint.

Recorded pricing tiers
TierInput / 1MOutput / 1MCached input / 1MCache write / 1MDate & source
Default[object Object][object Object][object Object]—2026-10-03 · OpenRouter source
Recorded pricing notes

OR launch promo rates ($0.04/$0.15); vendor standard list $0.20/$0.75.; min-healthy endpoint minima 2026-10-01; discount flag 0.8 on Inception (undocumented, not applied); discount flag 0.8 on Inception (undocumented, not applied); discount flag 0.8 on Inception (undocumented, not applied); min-healthy endpoint minima 2026-10-01; discount flag 0.8 on Inception (undocumented, not applied); discount flag 0.8 on Inception (undocumented, not applied); discount flag 0.8 on Inception (undocumented, not applied); min-healthy endpoint minima 2026-10-02; discount flag 0.8 on Inception (undocumented, not applied); discount flag 0.8 on Inception (undocumented, not applied); discount flag 0.8 on Inception (undocumented, not applied); min-healthy endpoint minima 2026-10-03; discount flag 0.8 on Inception (undocumented, not applied); discount flag 0.8 on Inception (undocumented, not applied); discount flag 0.8 on Inception (undocumented, not applied)

Official / vendor benchmarks

Default headline records. Own-vendor, peer-vendor and third-party provenance remain visible in evidence; configurations may differ.

Official / vendor headline scores; expand evidence for every record
Benchmark / evaluatorHeadline scoreEvidence
τ³-Bench Telecom96%unknown effort
All 1 recorded result & sources

96% · raw 96 %

Headline · unknown effort · Own vendor

Source/record date: 2026-09-08

from chart/figure on Inception Mercury 2.5 release post (alt: Mercury 2.5 vs Mercury 2.0); Tau3Bench Telecom

https://www.inceptionlabs.ai/blog/introducing-mercury-2-5
GPQA Diamond79%unknown effort
All 1 recorded result & sources

79% · raw 79 %

Headline · unknown effort · Own vendor

Source/record date: 2026-09-08

from chart/figure on Inception Mercury 2.5 release post (alt: Mercury 2.5 vs Mercury 2.0)

https://www.inceptionlabs.ai/blog/introducing-mercury-2-5
IFBench77%unknown effort
All 1 recorded result & sources

77% · raw 77 %

Headline · unknown effort · Own vendor

Source/record date: 2026-09-08

from chart/figure on Inception Mercury 2.5 release post (alt: Mercury 2.5 vs Mercury 2.0)

https://www.inceptionlabs.ai/blog/introducing-mercury-2-5
AA-LCR68%unknown effort
All 1 recorded result & sources

68% · raw 68 %

Headline · unknown effort · Own vendor

Source/record date: 2026-09-08

from chart/figure on Inception Mercury 2.5 release post (alt: Mercury 2.5 vs Mercury 2.0)

https://www.inceptionlabs.ai/blog/introducing-mercury-2-5
SciCode38%unknown effort
All 1 recorded result & sources

38% · raw 38 %

Headline · unknown effort · Own vendor

Source/record date: 2026-09-08

from chart/figure on Inception Mercury 2.5 release post (alt: Mercury 2.5 vs Mercury 2.0)

https://www.inceptionlabs.ai/blog/introducing-mercury-2-5
TerminalBench (unspecified version)37%unknown effort
All 1 recorded result & sources

37% · raw 37 %

Headline · unknown effort · Own vendor

Source/record date: 2026-09-08

from chart/figure on Inception Mercury 2.5 release post (alt: Mercury 2.5 vs Mercury 2.0); labeled TerminalBench (version not shown on chart)

https://www.inceptionlabs.ai/blog/introducing-mercury-2-5
DeepSearchQA34%unknown effort
All 1 recorded result & sources

34% · raw 34 %

Headline · unknown effort · Own vendor

Source/record date: 2026-09-08

from chart/figure on Inception Mercury 2.5 release post (alt: Mercury 2.5 vs Mercury 2.0); labeled DSQA (@10 tool calls)

https://www.inceptionlabs.ai/blog/introducing-mercury-2-5
AA-Omniscience Non-Hallucination33%unknown effort
All 1 recorded result & sources

33% · raw 33 %

Headline · unknown effort · Own vendor

Source/record date: 2026-09-08

from chart/figure on Inception Mercury 2.5 release post (alt: Mercury 2.5 vs Mercury 2.0); Omniscience Non-Hallucination

https://www.inceptionlabs.ai/blog/introducing-mercury-2-5
AA-Omniscience Accuracy22%unknown effort
All 1 recorded result & sources

22% · raw 22 %

Headline · unknown effort · Own vendor

Source/record date: 2026-09-08

from chart/figure on Inception Mercury 2.5 release post (alt: Mercury 2.5 vs Mercury 2.0); Omniscience Accuracy

https://www.inceptionlabs.ai/blog/introducing-mercury-2-5
GDPval21unknown effort
All 1 recorded result & sources

21 · raw 21 Elo

Headline · unknown effort · Own vendor

Source/record date: 2026-09-08

from chart/figure on Inception Mercury 2.5 release post (alt: Mercury 2.5 vs Mercury 2.0); labeled GDPVal (Elo) but plotted on 0–100% axis — recorded as chart value 21

https://www.inceptionlabs.ai/blog/introducing-mercury-2-5
Throughput (tok/s)1107 tok/sunknown effort
All 1 recorded result & sources

1107 tok/s · raw 1107 tok/s

Headline · unknown effort · Own vendor

Source/record date: 2026-09-08

from chart/figure Speed Benchmark on Mercury 2.5 release; NVIDIA GPUs per post copy

https://www.inceptionlabs.ai/blog/introducing-mercury-2-5

Independent evaluators

Evaluator harnesses are distinct from vendor measurements. Missing coverage is not a failed test.

Independent evaluator headline scores; expand evidence for every record
Benchmark / evaluatorHeadline scoreEvidence
Vals Index · Vals AI8.9%unknown effort
All 1 recorded result & sources

8.9% · raw 8.86 %

Headline · unknown effort · Independent evaluator

Source/record date: 2026-10-03

Refreshed from current Vals leaderboard. Cost/test $0.29.

https://www.vals.ai/benchmarks/vals_index
Intelligence Index · Artificial Analysis12unknown effort
All 1 recorded result & sources

12 · raw 12 index

Headline · unknown effort · Independent evaluator

Source/record date: 2026-10-03

Current AA model leaderboard;

https://artificialanalysis.ai/models/mercury-2-5
Output speed · Artificial Analysis712 tok/sunknown effort
All 1 recorded result & sources

712 tok/s · raw 712 tok/s

Headline · unknown effort · Independent evaluator

Source/record date: 2026-10-03

Current AA model leaderboard; Median output tokens/s; leaderboard rounds to whole tokens.

https://artificialanalysis.ai/models/mercury-2-5
Cost per Intelligence Index task · Artificial Analysis$0.12unknown effort
All 1 recorded result & sources

$0.12 · raw 0.12 USD

Headline · unknown effort · Independent evaluator

Source/record date: 2026-10-03

Current AA model leaderboard;

https://artificialanalysis.ai/models/mercury-2-5
Vibe Code Bench v1.1 · Vals AI3.7%unknown effort
All 1 recorded result & sources

3.7% · raw 3.68 %

Headline · unknown effort · Independent evaluator

Source/record date: 2026-10-03

Refreshed from current Vals leaderboard. Harness: OpenHands. Cost/test $0.38.

https://www.vals.ai/benchmarks/vibe-code

Read how we select and source scores or the comparison guide.