The benchmark library
Choose what to compare.
Browse by category, then open a benchmark to see every model’s results.
Data coverage
Choose a model to see which benchmarks have recorded results and which are missing.
Explore coverage → Explore changes by dateResults over time
Choose a benchmark, then drag its timeline to see the scores we had recorded at each date.
Open benchmark timelines →Loading benchmark library…
Gray Swan IPI
Gray Swan Indirect Prompt Injection benchmark: attack success rate at K=15 attempts. Lower is better.
11 with results · 22 missing · 33 models
Lower is better · %. Missing results are not zero. Expand Evidence for source dates, efforts and harness notes.
| Provider | Published / checked | Evidence | ||
|---|---|---|---|---|
| Gemini 4 ArgonGoogle | 0.7% | 2026-09-30 | All 2 recorded results & sources0.7% · raw 0.7 % Headline · max effort · Own vendor Source/record date: 2026-09-30 K=15 attack success rate (lower better); sourced from Gray Swan; leads chart | Highest thinking settings per Google eval methodology. https://storage.googleapis.com/gweb-uniblog-publish-prod/images/gemini_4_cyber_evals_gray_swan_i.width-1200.format-webp.webp0.7% · raw 0.7 % Alternative · unknown effort · Peer vendor Source/record date: 2026-10-07 Anthropic Haiku 5.5 system card, p. 50. Q1+Q2 2026 IPI suite; probability attacker succeeds in k attempts; extended thinking, no product-specific prompt-injection protections. Do not mix with older challenge sets. Gemini/Kimi effort unspecified. Alternative evidence; existing headline/configuration retained. No averaging. https://www-cdn.anthropic.com/e1080d6bf5ae2018ea3c2f414064be03232f5be5/Claude%20Haiku%205.5%20System%20Card.pdf#page=50 | |
| Claude Fable 5.1Anthropic | Anthropic | 1% | 2026-09-30 | All 2 recorded results & sources1% · raw 1 % Headline · unknown effort · Peer vendor Source/record date: 2026-09-30 As reported by Google Gemini 4 Argon chart; peer harness notes in Google eval methodology https://storage.googleapis.com/gweb-uniblog-publish-prod/images/gemini_4_cyber_evals_gray_swan_i.width-1200.format-webp.webp1% · raw 1 % Alternative · unknown effort · Own vendor Source/record date: 2026-10-07 Anthropic Haiku 5.5 system card, p. 50. Q1+Q2 2026 IPI suite; probability attacker succeeds in k attempts; extended thinking, no product-specific prompt-injection protections. Do not mix with older challenge sets. Gemini/Kimi effort unspecified. Alternative evidence; existing headline/configuration retained. No averaging. https://www-cdn.anthropic.com/e1080d6bf5ae2018ea3c2f414064be03232f5be5/Claude%20Haiku%205.5%20System%20Card.pdf#page=50 |
| Claude Opus 5.5Anthropic | Anthropic | 1% | 2026-09-30 | All 2 recorded results & sources1% · raw 1 % Headline · unknown effort · Peer vendor Source/record date: 2026-09-30 As reported by Google Gemini 4 Argon chart; peer harness notes in Google eval methodology https://storage.googleapis.com/gweb-uniblog-publish-prod/images/gemini_4_cyber_evals_gray_swan_i.width-1200.format-webp.webp1% · raw 1 % Alternative · unknown effort · Own vendor Source/record date: 2026-10-07 Anthropic Haiku 5.5 system card, p. 50. Q1+Q2 2026 IPI suite; probability attacker succeeds in k attempts; extended thinking, no product-specific prompt-injection protections. Do not mix with older challenge sets. Gemini/Kimi effort unspecified. Alternative evidence; existing headline/configuration retained. No averaging. https://www-cdn.anthropic.com/e1080d6bf5ae2018ea3c2f414064be03232f5be5/Claude%20Haiku%205.5%20System%20Card.pdf#page=50 |
| Claude Sonnet 5.5Anthropic | Anthropic | 3.4% | 2026-10-07 | All 1 recorded result & sources3.4% · raw 3.4 % Headline · unknown effort · Own vendor Source/record date: 2026-10-07 Anthropic Haiku 5.5 system card, p. 50. Q1+Q2 2026 IPI suite; probability attacker succeeds in k attempts; extended thinking, no product-specific prompt-injection protections. Do not mix with older challenge sets. Gemini/Kimi effort unspecified. https://www-cdn.anthropic.com/e1080d6bf5ae2018ea3c2f414064be03232f5be5/Claude%20Haiku%205.5%20System%20Card.pdf#page=50 |
| Gemini 3.8 FlashGoogle | 5.5% | 2026-09-30 | All 2 recorded results & sources5.5% · raw 5.5 % Headline · unknown effort · Peer vendor Source/record date: 2026-09-30 As reported by Google Gemini 4 Argon Gray Swan chart (K=15 attack success rate) https://storage.googleapis.com/gweb-uniblog-publish-prod/images/gemini_4_cyber_evals_gray_swan_i.width-1200.format-webp.webp5.5% · raw 5.5 % Alternative · unknown effort · Peer vendor Source/record date: 2026-10-07 Anthropic Haiku 5.5 system card, p. 50. Q1+Q2 2026 IPI suite; probability attacker succeeds in k attempts; extended thinking, no product-specific prompt-injection protections. Do not mix with older challenge sets. Gemini/Kimi effort unspecified. Alternative evidence; existing headline/configuration retained. No averaging. https://www-cdn.anthropic.com/e1080d6bf5ae2018ea3c2f414064be03232f5be5/Claude%20Haiku%205.5%20System%20Card.pdf#page=50 | |
| Claude Haiku 5.5Anthropic | Anthropic | 7.1% | 2026-10-07 | All 1 recorded result & sources7.1% · raw 7.1 % Headline · unknown effort · Own vendor Source/record date: 2026-10-07 Anthropic Haiku 5.5 system card, p. 50. Q1+Q2 2026 IPI suite; probability attacker succeeds in k attempts; extended thinking, no product-specific prompt-injection protections. Do not mix with older challenge sets. Gemini/Kimi effort unspecified. https://www-cdn.anthropic.com/e1080d6bf5ae2018ea3c2f414064be03232f5be5/Claude%20Haiku%205.5%20System%20Card.pdf#page=50 |
| GPT-6 AstraOpenAI | OpenAI | 8.5% | 2026-09-30 | All 1 recorded result & sources8.5% · raw 8.5 % Headline · unknown effort · Peer vendor Source/record date: 2026-09-30 As reported by Google Gemini 4 Argon chart; peer harness notes in Google eval methodology https://storage.googleapis.com/gweb-uniblog-publish-prod/images/gemini_4_cyber_evals_gray_swan_i.width-1200.format-webp.webp |
| Muse Spark 1.3Meta | Meta | 15.9% | 2026-09-30 | All 1 recorded result & sources15.9% · raw 15.9 % Headline · unknown effort · Peer vendor Source/record date: 2026-09-30 As reported by Google Gemini 4 Argon Gray Swan chart (K=15 attack success rate) https://storage.googleapis.com/gweb-uniblog-publish-prod/images/gemini_4_cyber_evals_gray_swan_i.width-1200.format-webp.webp |
| GPT-6 LunaOpenAI | OpenAI | 28.7% | 2026-10-07 | All 1 recorded result & sources28.7% · raw 28.7 % Headline · unknown effort · Peer vendor Source/record date: 2026-10-07 Anthropic Haiku 5.5 system card, p. 50. Q1+Q2 2026 IPI suite; probability attacker succeeds in k attempts; extended thinking, no product-specific prompt-injection protections. Do not mix with older challenge sets. Gemini/Kimi effort unspecified. https://www-cdn.anthropic.com/e1080d6bf5ae2018ea3c2f414064be03232f5be5/Claude%20Haiku%205.5%20System%20Card.pdf#page=50 |
| GLM-5.3Z.ai | Z.ai | 31.5% | 2026-09-30 | All 1 recorded result & sources31.5% · raw 31.5 % Headline · unknown effort · Peer vendor Source/record date: 2026-09-30 As reported by Google Gemini 4 Argon Gray Swan chart (K=15 attack success rate) https://storage.googleapis.com/gweb-uniblog-publish-prod/images/gemini_4_cyber_evals_gray_swan_i.width-1200.format-webp.webp |
| Kimi K3Moonshot AI | Moonshot AI | 52.7% | 2026-09-30 | All 2 recorded results & sources52.7% · raw 52.7 % Headline · unknown effort · Peer vendor Source/record date: 2026-09-30 As reported by Google Gemini 4 Argon Gray Swan chart (K=15 attack success rate) https://storage.googleapis.com/gweb-uniblog-publish-prod/images/gemini_4_cyber_evals_gray_swan_i.width-1200.format-webp.webp52.7% · raw 52.7 % Alternative · unknown effort · Peer vendor Source/record date: 2026-10-07 Anthropic Haiku 5.5 system card, p. 50. Q1+Q2 2026 IPI suite; probability attacker succeeds in k attempts; extended thinking, no product-specific prompt-injection protections. Do not mix with older challenge sets. Gemini/Kimi effort unspecified. Alternative evidence; existing headline/configuration retained. No averaging. https://www-cdn.anthropic.com/e1080d6bf5ae2018ea3c2f414064be03232f5be5/Claude%20Haiku%205.5%20System%20Card.pdf#page=50 |
| BeamReflection AI | Reflection AI | — | — | No recorded result |
| DeepSeek V4.1 FlashDeepSeek | DeepSeek | — | — | No recorded result |
| GLM-5.3-FlashZ.ai | Z.ai | — | — | No recorded result |
| GPT-5.6 TerraOpenAI | OpenAI | — | — | No recorded result |
| GPT-6.1 SolOpenAI | OpenAI | — | — | No recorded result |
| Grok 4.7xAI | xAI | — | — | No recorded result |
| Hy4 previewTencent | Tencent | — | — | No recorded result |
| Kolibri-1Aleph Alpha | Aleph Alpha | — | — | No recorded result |
| Ling 3.0 Flash VLinclusionAI | inclusionAI | — | — | No recorded result |
| Ling 3.1 FlashinclusionAI | inclusionAI | — | — | No recorded result |
| Mercury 2.5Inception | Inception | — | — | No recorded result |
| MiMo-V2.6-Distill-Qwen-9BXiaomi | Xiaomi | — | — | No recorded result |
| MiMo-V2.6-FlashXiaomi | Xiaomi | — | — | No recorded result |
| MiMo-V2.6-ProXiaomi | Xiaomi | — | — | No recorded result |
| Mistral Large 4Mistral AI | Mistral AI | — | — | No recorded result |
| Naive-N0.5-FlashNaiveAI | NaiveAI | — | — | No recorded result |
| Nex-N2.5-ProNex AGI | Nex AGI | — | — | No recorded result |
| Pareto 26.10 PreviewUnbiased | Unbiased | — | — | No recorded result |
| Qwen3.8 27BAlibaba (Qwen) | Alibaba (Qwen) | — | — | No recorded result |
| Qwen3.8 FlashAlibaba (Qwen) | Alibaba (Qwen) | — | — | No recorded result |
| Qwen3.8 Max (0902)Alibaba (Qwen) | Alibaba (Qwen) | — | — | No recorded result |
| Qwen3.8 Omni FlashAlibaba (Qwen) | Alibaba (Qwen) | — | — | No recorded result |