GPT-6 Luna Benchmarks, Specifications & Availability
Explore GPT-6 Luna from OpenAI: published specifications, source-linked vendor benchmarks, independent evaluator coverage and recorded pricing when available.
Compare GPT-6 Luna with other models →Explore data coverage
Published specifications
- Provider
- OpenAI
- Access
- Proprietary
- License
- Proprietary
- Context window
- 1.05M
- Total parameters
- Not published
- Active parameters
- Not published
- Released
- 2026-09-22
- Modalities
- file, image, text
- Family
- GPT-6
Model card · Announcement · Website · OpenRouter
Model notes
Cheapest GPT-6 tier; 50% below GPT-5.6 Luna promo pricing. Knowledge cutoff May 18, 2026.
Pricing · OpenRouter
Dated cached OpenRouter rates in USD per 1M tokens. Open the dashboard for live enhancements. Per-metric endpoint minima can refer to different providers; they are not a guaranteed combined rate from one endpoint.
| Tier | Input / 1M | Output / 1M | Cached input / 1M | Cache write / 1M | Date & source |
|---|---|---|---|---|---|
| Default | [object Object] | [object Object] | [object Object] | [object Object] | 2026-10-03 · OpenRouter source |
Recorded pricing notes
Official docs: prompts >272K input billed 2x input/cache and 1.5x output for full request; cache write ~1.25x input.; min-healthy endpoint minima 2026-10-01; time-window overrides apply on a winning provider; min-healthy endpoint minima 2026-10-01; time-window overrides apply on a winning provider; min-healthy endpoint minima 2026-10-02; time-window overrides apply on a winning provider; min-healthy endpoint minima 2026-10-03; time-window overrides apply on a winning provider
Official / vendor benchmarks
Default headline records. Own-vendor, peer-vendor and third-party provenance remain visible in evidence; configurations may differ.
| Benchmark / evaluator | Headline score | Evidence |
|---|---|---|
| DeepSWE v1.1 | 66.6%max effort | All 1 recorded result & sources66.6% · raw 66.6 % Headline · max effort · Own vendor Source/record date: 2026-09-22 max effort https://openai.com/index/introducing-gpt-6-sol-and-luna/ |
| ExploitGym | 11.6%unknown effort | All 1 recorded result & sources11.6% · raw 11.6 % Headline · unknown effort · Own vendor Source/record date: 2026-09-22 Astra system card Sol/Luna appendix; ExploitGym success rate https://deploymentsafety.openai.com/gpt-6-astra |
| HealthBench Professional | 60.8%unknown effort | All 1 recorded result & sources60.8% · raw 60.8 % Headline · unknown effort · Own vendor Source/record date: 2026-09-22 length-adjusted (raw 61.2, mean length 2119 chars); Astra card Sol/Luna appendix https://deploymentsafety.openai.com/gpt-6-astra |
| HealthBench Hard | 31.4%unknown effort | All 1 recorded result & sources31.4% · raw 31.4 % Headline · unknown effort · Own vendor Source/record date: 2026-09-22 length-adjusted (raw 25.4, mean length 1241 chars); Astra card Sol/Luna appendix https://deploymentsafety.openai.com/gpt-6-astra |
| SEC-Bench Pro | 34.2%unknown effort | All 1 recorded result & sources34.2% · raw 34.2 % Headline · unknown effort · Own vendor Source/record date: 2026-09-22 Astra system card Sol/Luna appendix https://deploymentsafety.openai.com/gpt-6-astra |
| ExploitBench | 43.4%max effort | All 1 recorded result & sources43.4% · raw 43.4 % Headline · max effort · Own vendor Source/record date: 2026-09-23 GPT-6 Astra system card appendix §11.8.1.2.1: GPT-6 Luna at maximum reasoning effort https://deploymentsafety.openai.com/gpt-6-astra |
Independent evaluators
Evaluator harnesses are distinct from vendor measurements. Missing coverage is not a failed test.
| Benchmark / evaluator | Headline score | Evidence |
|---|---|---|
| Intelligence Index · Artificial Analysis | 38max effort | All 6 recorded results & sources38 · raw 38 index Headline · max effort · Independent evaluator Source/record date: 2026-10-03 Current AA model leaderboard; https://artificialanalysis.ai/models/gpt-6-luna35 · raw 35 index Alternative · xhigh effort · Independent evaluator Source/record date: 2026-10-03 Current AA model leaderboard; https://artificialanalysis.ai/models/gpt-6-luna-xhigh33 · raw 33 index Alternative · high effort · Independent evaluator Source/record date: 2026-10-03 Current AA model leaderboard; https://artificialanalysis.ai/models/gpt-6-luna-high30 · raw 30 index Alternative · medium effort · Independent evaluator Source/record date: 2026-10-03 Current AA model leaderboard; https://artificialanalysis.ai/models/gpt-6-luna-medium22 · raw 22 index Alternative · low effort · Independent evaluator Source/record date: 2026-10-03 Current AA model leaderboard; https://artificialanalysis.ai/models/gpt-6-luna-low18 · raw 18 index Alternative · none effort · Independent evaluator Source/record date: 2026-10-03 Current AA model leaderboard; https://artificialanalysis.ai/models/gpt-6-luna-non-reasoning |
| Vals Index · Vals AI | 51.2%max effort | All 1 recorded result & sources51.2% · raw 51.22 % Headline · max effort · Independent evaluator Source/record date: 2026-10-03 Refreshed from current Vals leaderboard. Cost/test $0.43. https://www.vals.ai/benchmarks/vals_index |
| Vibe Code Bench v1.1 · Vals AI | 81.7%unknown effort | All 1 recorded result & sources81.7% · raw 81.65 % Headline · unknown effort · Independent evaluator Source/record date: 2026-10-03 Refreshed from current Vals leaderboard. Harness: OpenHands. Cost/test $1.35. https://www.vals.ai/benchmarks/vibe-code |
| ARC-AGI-1 · ARC Prize | 86.7%max effort | All 6 recorded results & sources86.7% · raw 86.7 % Headline · max effort · Independent evaluator Source/record date: 2026-10-03 Semi-Private verified matrix. Published verified configuration. Headline: best verified value; source matrix effort order breaks ties. https://arcprize.org/results/openai-gpt-6-luna73% · raw 73 % Alternative · xhigh effort · Independent evaluator Source/record date: 2026-10-03 Semi-Private verified matrix. Published verified configuration. https://arcprize.org/results/openai-gpt-6-luna70.3% · raw 70.3 % Alternative · high effort · Independent evaluator Source/record date: 2026-10-03 Semi-Private verified matrix. Published verified configuration. https://arcprize.org/results/openai-gpt-6-luna61% · raw 61 % Alternative · medium effort · Independent evaluator Source/record date: 2026-10-03 Semi-Private verified matrix. Published verified configuration. https://arcprize.org/results/openai-gpt-6-luna37.7% · raw 37.7 % Alternative · low effort · Independent evaluator Source/record date: 2026-10-03 Semi-Private verified matrix. Published verified configuration. https://arcprize.org/results/openai-gpt-6-luna8.8% · raw 8.8 % Alternative · none effort · Independent evaluator Source/record date: 2026-10-03 Semi-Private verified matrix. Published verified configuration. https://arcprize.org/results/openai-gpt-6-luna |
| ARC-AGI-2 · ARC Prize | 59.3%max effort | All 6 recorded results & sources59.3% · raw 59.3 % Headline · max effort · Independent evaluator Source/record date: 2026-10-03 Semi-Private verified matrix. Published verified configuration. Headline: best verified value; source matrix effort order breaks ties. https://arcprize.org/results/openai-gpt-6-luna41.9% · raw 41.9 % Alternative · xhigh effort · Independent evaluator Source/record date: 2026-10-03 Semi-Private verified matrix. Published verified configuration. https://arcprize.org/results/openai-gpt-6-luna31.4% · raw 31.4 % Alternative · high effort · Independent evaluator Source/record date: 2026-10-03 Semi-Private verified matrix. Published verified configuration. https://arcprize.org/results/openai-gpt-6-luna18.1% · raw 18.1 % Alternative · medium effort · Independent evaluator Source/record date: 2026-10-03 Semi-Private verified matrix. Published verified configuration. https://arcprize.org/results/openai-gpt-6-luna4.6% · raw 4.6 % Alternative · low effort · Independent evaluator Source/record date: 2026-10-03 Semi-Private verified matrix. Published verified configuration. https://arcprize.org/results/openai-gpt-6-luna0% · raw 0 % Alternative · none effort · Independent evaluator Source/record date: 2026-10-03 Semi-Private verified matrix. Published verified configuration. https://arcprize.org/results/openai-gpt-6-luna |
| ARC-AGI-3 (Standard) · ARC Prize | 0.2%medium effort | All 6 recorded results & sources0.1% · raw 0.1 % Alternative · max effort · Independent evaluator Source/record date: 2026-10-03 Semi-Private verified matrix. Harness: Standard (notes carry). https://arcprize.org/results/openai-gpt-6-luna0.2% · raw 0.16 % Alternative · xhigh effort · Independent evaluator Source/record date: 2026-10-03 Semi-Private verified matrix. Harness: Standard (notes carry). https://arcprize.org/results/openai-gpt-6-luna0.2% · raw 0.18 % Alternative · high effort · Independent evaluator Source/record date: 2026-10-03 Semi-Private verified matrix. Harness: Standard (notes carry). https://arcprize.org/results/openai-gpt-6-luna0.2% · raw 0.19 % Headline · medium effort · Independent evaluator Source/record date: 2026-10-03 Semi-Private verified matrix. Harness: Standard (notes carry). Headline: best verified value; source matrix effort order breaks ties. https://arcprize.org/results/openai-gpt-6-luna0% · raw 0.03 % Alternative · low effort · Independent evaluator Source/record date: 2026-10-03 Semi-Private verified matrix. Harness: Standard (notes carry). https://arcprize.org/results/openai-gpt-6-luna0% · raw 0.03 % Alternative · none effort · Independent evaluator Source/record date: 2026-10-03 Semi-Private verified matrix. Harness: Standard (notes carry). https://arcprize.org/results/openai-gpt-6-luna |
| ARC-AGI-3 · ARC Prize | 0.6%max effort | All 6 recorded results & sources0.6% · raw 0.59 % Headline · max effort · Independent evaluator Source/record date: 2026-10-03 Semi-Private verified matrix. Harness: Provider Adapter. Headline: best verified value; source matrix effort order breaks ties. https://arcprize.org/results/openai-gpt-6-luna0.5% · raw 0.51 % Alternative · xhigh effort · Independent evaluator Source/record date: 2026-10-03 Semi-Private verified matrix. Harness: Provider Adapter. https://arcprize.org/results/openai-gpt-6-luna0.4% · raw 0.38 % Alternative · high effort · Independent evaluator Source/record date: 2026-10-03 Semi-Private verified matrix. Harness: Provider Adapter. https://arcprize.org/results/openai-gpt-6-luna0.3% · raw 0.32 % Alternative · medium effort · Independent evaluator Source/record date: 2026-10-03 Semi-Private verified matrix. Harness: Provider Adapter. https://arcprize.org/results/openai-gpt-6-luna0.2% · raw 0.24 % Alternative · low effort · Independent evaluator Source/record date: 2026-10-03 Semi-Private verified matrix. Harness: Provider Adapter. https://arcprize.org/results/openai-gpt-6-luna0.1% · raw 0.05 % Alternative · none effort · Independent evaluator Source/record date: 2026-10-03 Semi-Private verified matrix. Harness: Provider Adapter. https://arcprize.org/results/openai-gpt-6-luna |
| GDPval-AA Elo · Artificial Analysis | 1367max effort | All 1 recorded result & sources1367 · raw 1367 Elo Headline · max effort · Independent evaluator Source/record date: 2026-09-23 GDPval-AA v2.1 Elo; GPT-6 Luna (max) https://artificialanalysis.ai/evaluations/gdpval-aa |
| Output speed · Artificial Analysis | 131 tok/smax effort | All 5 recorded results & sources131 tok/s · raw 131 tok/s Headline · max effort · Independent evaluator Source/record date: 2026-10-03 Current AA model leaderboard; Median output tokens/s; leaderboard rounds to whole tokens. https://artificialanalysis.ai/models/gpt-6-luna138 tok/s · raw 138 tok/s Alternative · xhigh effort · Independent evaluator Source/record date: 2026-10-03 Current AA model leaderboard; Median output tokens/s; leaderboard rounds to whole tokens. https://artificialanalysis.ai/models/gpt-6-luna-xhigh135 tok/s · raw 135 tok/s Alternative · high effort · Independent evaluator Source/record date: 2026-10-03 Current AA model leaderboard; Median output tokens/s; leaderboard rounds to whole tokens. https://artificialanalysis.ai/models/gpt-6-luna-high131 tok/s · raw 131 tok/s Alternative · low effort · Independent evaluator Source/record date: 2026-10-03 Current AA model leaderboard; Median output tokens/s; leaderboard rounds to whole tokens. https://artificialanalysis.ai/models/gpt-6-luna-low130 tok/s · raw 130 tok/s Alternative · none effort · Independent evaluator Source/record date: 2026-10-03 Current AA model leaderboard; Median output tokens/s; leaderboard rounds to whole tokens. https://artificialanalysis.ai/models/gpt-6-luna-non-reasoning |
| Cost per Intelligence Index task · Artificial Analysis | $0.07max effort | All 6 recorded results & sources$0.07 · raw 0.07 USD Headline · max effort · Independent evaluator Source/record date: 2026-10-03 Current AA model leaderboard; https://artificialanalysis.ai/models/gpt-6-luna$0.04 · raw 0.04 USD Alternative · xhigh effort · Independent evaluator Source/record date: 2026-10-03 Current AA model leaderboard; https://artificialanalysis.ai/models/gpt-6-luna-xhigh$0.03 · raw 0.03 USD Alternative · high effort · Independent evaluator Source/record date: 2026-10-03 Current AA model leaderboard; https://artificialanalysis.ai/models/gpt-6-luna-high$0.02 · raw 0.02 USD Alternative · medium effort · Independent evaluator Source/record date: 2026-10-03 Current AA model leaderboard; https://artificialanalysis.ai/models/gpt-6-luna-medium$0.00 · raw 0.0045 USD Alternative · low effort · Independent evaluator Source/record date: 2026-10-03 Current AA model leaderboard; https://artificialanalysis.ai/models/gpt-6-luna-low$0.01 · raw 0.01 USD Alternative · none effort · Independent evaluator Source/record date: 2026-10-03 Current AA model leaderboard; https://artificialanalysis.ai/models/gpt-6-luna-non-reasoning |
| Bugs fixed /105 · Bug Hunt Bench | 18.3 fixesmax effort | All 5 recorded results & sources18.3 fixes · raw 18.3 fixes Headline · max effort · Independent evaluator Source/record date: 2026-10-03 Harness: Codex CLI; effort max; 3 runs; evaluation 2026-09-23. Best documented score for this effort in Oct 1 README. Headline: best documented model run. https://github.com/phuryn/bug-hunt-bench14 fixes · raw 14 fixes Alternative · xhigh effort · Independent evaluator Source/record date: 2026-10-03 Harness: Codex CLI; effort xhigh; 1 runs; evaluation 2026-09-23. Best documented score for this effort in Oct 1 README. https://github.com/phuryn/bug-hunt-bench9 fixes · raw 9 fixes Alternative · high effort · Independent evaluator Source/record date: 2026-10-03 Harness: Codex CLI; effort high; 1 runs; evaluation 2026-09-23. Best documented score for this effort in Oct 1 README. https://github.com/phuryn/bug-hunt-bench4 fixes · raw 4 fixes Alternative · medium effort · Independent evaluator Source/record date: 2026-10-03 Harness: Codex CLI; effort medium; 1 runs; evaluation 2026-09-23. Best documented score for this effort in Oct 1 README. https://github.com/phuryn/bug-hunt-bench4 fixes · raw 4 fixes Alternative · low effort · Independent evaluator Source/record date: 2026-10-03 Harness: Codex CLI; effort low; 1 runs; evaluation 2026-09-23. Best documented score for this effort in Oct 1 README. https://github.com/phuryn/bug-hunt-bench |
| Blueprint Bench · Andon Labs | 31.2%unknown effort | All 1 recorded result & sources31.2% · raw 31.2 % Headline · unknown effort · Independent evaluator Source/record date: 2026-10-03 Blueprint-Bench 2 connectivity similarity; published fractional score multiplied by 100. https://andonlabs.com/evals/blueprint-bench-2 |
| Average Score · WeirdML v3 | 7.9%xhigh effort | All 1 recorded result & sources7.9% · raw 7.87 % Headline · xhigh effort · Independent evaluator Source/record date: 2026-10-02 WeirdML variant GPT-6 Luna (xhigh); harness codex_cli 0.156.0; values from prepared data JSON; raw 0.078741; official 80/20 aggregate (area 500k-50M tokens + final best) https://htihle.github.io/weirdml.html |
| Final Best Score · WeirdML v3 | 12%xhigh effort | All 1 recorded result & sources12% · raw 12.02 % Headline · xhigh effort · Independent evaluator Source/record date: 2026-10-02 WeirdML variant GPT-6 Luna (xhigh); harness codex_cli 0.156.0; values from prepared data JSON; raw 0.120228; mean final best effective score https://htihle.github.io/weirdml.html |
| Cost / Run · WeirdML v3 | $0.32xhigh effort | All 1 recorded result & sources$0.32 · raw 0.32 USD Headline · xhigh effort · Independent evaluator Source/record date: 2026-10-02 WeirdML variant GPT-6 Luna (xhigh); harness codex_cli 0.156.0; values from prepared data JSON; mean API cost per run, same task weighting as scores https://htihle.github.io/weirdml.html |
Read how we select and source scores or the comparison guide.