Mercury 2.5 Benchmarks, Specifications & Availability
Explore Mercury 2.5 from Inception: published specifications, source-linked vendor benchmarks, independent evaluator coverage and recorded pricing when available.
Compare Mercury 2.5 with other models →Explore data coverage
Published specifications
- Provider
- Inception
- Access
- Proprietary
- License
- Proprietary
- Context window
- 260K
- Total parameters
- Not published
- Active parameters
- Not published
- Released
- 2026-09-08
- Modalities
- text
- Family
- Mercury
Announcement · Website · OpenRouter
Model notes
Diffusion LLM (dLLM); tunable reasoning, parallel tool calls, JSON mode. Official quality numbers harvested from results figure on release post (2026-09-23 figure harvest).
Pricing · OpenRouter
Dated cached OpenRouter rates in USD per 1M tokens. Open the dashboard for live enhancements. Per-metric endpoint minima can refer to different providers; they are not a guaranteed combined rate from one endpoint.
| Tier | Input / 1M | Output / 1M | Cached input / 1M | Cache write / 1M | Date & source |
|---|---|---|---|---|---|
| Default | [object Object] | [object Object] | [object Object] | — | 2026-10-03 · OpenRouter source |
Recorded pricing notes
OR launch promo rates ($0.04/$0.15); vendor standard list $0.20/$0.75.; min-healthy endpoint minima 2026-10-01; discount flag 0.8 on Inception (undocumented, not applied); discount flag 0.8 on Inception (undocumented, not applied); discount flag 0.8 on Inception (undocumented, not applied); min-healthy endpoint minima 2026-10-01; discount flag 0.8 on Inception (undocumented, not applied); discount flag 0.8 on Inception (undocumented, not applied); discount flag 0.8 on Inception (undocumented, not applied); min-healthy endpoint minima 2026-10-02; discount flag 0.8 on Inception (undocumented, not applied); discount flag 0.8 on Inception (undocumented, not applied); discount flag 0.8 on Inception (undocumented, not applied); min-healthy endpoint minima 2026-10-03; discount flag 0.8 on Inception (undocumented, not applied); discount flag 0.8 on Inception (undocumented, not applied); discount flag 0.8 on Inception (undocumented, not applied)
Official / vendor benchmarks
Default headline records. Own-vendor, peer-vendor and third-party provenance remain visible in evidence; configurations may differ.
| Benchmark / evaluator | Headline score | Evidence |
|---|---|---|
| τ³-Bench Telecom | 96%unknown effort | All 1 recorded result & sources96% · raw 96 % Headline · unknown effort · Own vendor Source/record date: 2026-09-08 from chart/figure on Inception Mercury 2.5 release post (alt: Mercury 2.5 vs Mercury 2.0); Tau3Bench Telecom https://www.inceptionlabs.ai/blog/introducing-mercury-2-5 |
| GPQA Diamond | 79%unknown effort | All 1 recorded result & sources79% · raw 79 % Headline · unknown effort · Own vendor Source/record date: 2026-09-08 from chart/figure on Inception Mercury 2.5 release post (alt: Mercury 2.5 vs Mercury 2.0) https://www.inceptionlabs.ai/blog/introducing-mercury-2-5 |
| IFBench | 77%unknown effort | All 1 recorded result & sources77% · raw 77 % Headline · unknown effort · Own vendor Source/record date: 2026-09-08 from chart/figure on Inception Mercury 2.5 release post (alt: Mercury 2.5 vs Mercury 2.0) https://www.inceptionlabs.ai/blog/introducing-mercury-2-5 |
| AA-LCR | 68%unknown effort | All 1 recorded result & sources68% · raw 68 % Headline · unknown effort · Own vendor Source/record date: 2026-09-08 from chart/figure on Inception Mercury 2.5 release post (alt: Mercury 2.5 vs Mercury 2.0) https://www.inceptionlabs.ai/blog/introducing-mercury-2-5 |
| SciCode | 38%unknown effort | All 1 recorded result & sources38% · raw 38 % Headline · unknown effort · Own vendor Source/record date: 2026-09-08 from chart/figure on Inception Mercury 2.5 release post (alt: Mercury 2.5 vs Mercury 2.0) https://www.inceptionlabs.ai/blog/introducing-mercury-2-5 |
| TerminalBench (unspecified version) | 37%unknown effort | All 1 recorded result & sources37% · raw 37 % Headline · unknown effort · Own vendor Source/record date: 2026-09-08 from chart/figure on Inception Mercury 2.5 release post (alt: Mercury 2.5 vs Mercury 2.0); labeled TerminalBench (version not shown on chart) https://www.inceptionlabs.ai/blog/introducing-mercury-2-5 |
| DeepSearchQA | 34%unknown effort | All 1 recorded result & sources34% · raw 34 % Headline · unknown effort · Own vendor Source/record date: 2026-09-08 from chart/figure on Inception Mercury 2.5 release post (alt: Mercury 2.5 vs Mercury 2.0); labeled DSQA (@10 tool calls) https://www.inceptionlabs.ai/blog/introducing-mercury-2-5 |
| AA-Omniscience Non-Hallucination | 33%unknown effort | All 1 recorded result & sources33% · raw 33 % Headline · unknown effort · Own vendor Source/record date: 2026-09-08 from chart/figure on Inception Mercury 2.5 release post (alt: Mercury 2.5 vs Mercury 2.0); Omniscience Non-Hallucination https://www.inceptionlabs.ai/blog/introducing-mercury-2-5 |
| AA-Omniscience Accuracy | 22%unknown effort | All 1 recorded result & sources22% · raw 22 % Headline · unknown effort · Own vendor Source/record date: 2026-09-08 from chart/figure on Inception Mercury 2.5 release post (alt: Mercury 2.5 vs Mercury 2.0); Omniscience Accuracy https://www.inceptionlabs.ai/blog/introducing-mercury-2-5 |
| GDPval | 21unknown effort | All 1 recorded result & sources21 · raw 21 Elo Headline · unknown effort · Own vendor Source/record date: 2026-09-08 from chart/figure on Inception Mercury 2.5 release post (alt: Mercury 2.5 vs Mercury 2.0); labeled GDPVal (Elo) but plotted on 0–100% axis — recorded as chart value 21 https://www.inceptionlabs.ai/blog/introducing-mercury-2-5 |
| Throughput (tok/s) | 1107 tok/sunknown effort | All 1 recorded result & sources1107 tok/s · raw 1107 tok/s Headline · unknown effort · Own vendor Source/record date: 2026-09-08 from chart/figure Speed Benchmark on Mercury 2.5 release; NVIDIA GPUs per post copy https://www.inceptionlabs.ai/blog/introducing-mercury-2-5 |
Independent evaluators
Evaluator harnesses are distinct from vendor measurements. Missing coverage is not a failed test.
| Benchmark / evaluator | Headline score | Evidence |
|---|---|---|
| Vals Index · Vals AI | 8.9%unknown effort | All 1 recorded result & sources8.9% · raw 8.86 % Headline · unknown effort · Independent evaluator Source/record date: 2026-10-03 Refreshed from current Vals leaderboard. Cost/test $0.29. https://www.vals.ai/benchmarks/vals_index |
| Intelligence Index · Artificial Analysis | 12unknown effort | All 1 recorded result & sources12 · raw 12 index Headline · unknown effort · Independent evaluator Source/record date: 2026-10-03 Current AA model leaderboard; https://artificialanalysis.ai/models/mercury-2-5 |
| Output speed · Artificial Analysis | 712 tok/sunknown effort | All 1 recorded result & sources712 tok/s · raw 712 tok/s Headline · unknown effort · Independent evaluator Source/record date: 2026-10-03 Current AA model leaderboard; Median output tokens/s; leaderboard rounds to whole tokens. https://artificialanalysis.ai/models/mercury-2-5 |
| Cost per Intelligence Index task · Artificial Analysis | $0.12unknown effort | All 1 recorded result & sources$0.12 · raw 0.12 USD Headline · unknown effort · Independent evaluator Source/record date: 2026-10-03 Current AA model leaderboard; https://artificialanalysis.ai/models/mercury-2-5 |
| Vibe Code Bench v1.1 · Vals AI | 3.7%unknown effort | All 1 recorded result & sources3.7% · raw 3.68 % Headline · unknown effort · Independent evaluator Source/record date: 2026-10-03 Refreshed from current Vals leaderboard. Harness: OpenHands. Cost/test $0.38. https://www.vals.ai/benchmarks/vibe-code |
Read how we select and source scores or the comparison guide.