Examenos

Explore benchmarks · compare every showcased model

33 models
← All benchmarks
Official / vendor

Gray Swan IPI

Gray Swan Indirect Prompt Injection benchmark: attack success rate at K=15 attempts. Lower is better.

11 with results · 22 missing · 33 models

Lower is better · %. Missing results are not zero. Expand Evidence for source dates, efforts and harness notes.

Gray Swan IPI results for every showcased model
Provider Published / checked Evidence
Gemini 4 ArgonGoogleGoogle0.7%2026-09-30
All 2 recorded results & sources

0.7% · raw 0.7 %

Headline · max effort · Own vendor

Source/record date: 2026-09-30

K=15 attack success rate (lower better); sourced from Gray Swan; leads chart | Highest thinking settings per Google eval methodology.

https://storage.googleapis.com/gweb-uniblog-publish-prod/images/gemini_4_cyber_evals_gray_swan_i.width-1200.format-webp.webp

0.7% · raw 0.7 %

Alternative · unknown effort · Peer vendor

Source/record date: 2026-10-07

Anthropic Haiku 5.5 system card, p. 50. Q1+Q2 2026 IPI suite; probability attacker succeeds in k attempts; extended thinking, no product-specific prompt-injection protections. Do not mix with older challenge sets. Gemini/Kimi effort unspecified. Alternative evidence; existing headline/configuration retained. No averaging.

https://www-cdn.anthropic.com/e1080d6bf5ae2018ea3c2f414064be03232f5be5/Claude%20Haiku%205.5%20System%20Card.pdf#page=50
Claude Fable 5.1AnthropicAnthropic1%2026-09-30
All 2 recorded results & sources

1% · raw 1 %

Headline · unknown effort · Peer vendor

Source/record date: 2026-09-30

As reported by Google Gemini 4 Argon chart; peer harness notes in Google eval methodology

https://storage.googleapis.com/gweb-uniblog-publish-prod/images/gemini_4_cyber_evals_gray_swan_i.width-1200.format-webp.webp

1% · raw 1 %

Alternative · unknown effort · Own vendor

Source/record date: 2026-10-07

Anthropic Haiku 5.5 system card, p. 50. Q1+Q2 2026 IPI suite; probability attacker succeeds in k attempts; extended thinking, no product-specific prompt-injection protections. Do not mix with older challenge sets. Gemini/Kimi effort unspecified. Alternative evidence; existing headline/configuration retained. No averaging.

https://www-cdn.anthropic.com/e1080d6bf5ae2018ea3c2f414064be03232f5be5/Claude%20Haiku%205.5%20System%20Card.pdf#page=50
Claude Opus 5.5AnthropicAnthropic1%2026-09-30
All 2 recorded results & sources

1% · raw 1 %

Headline · unknown effort · Peer vendor

Source/record date: 2026-09-30

As reported by Google Gemini 4 Argon chart; peer harness notes in Google eval methodology

https://storage.googleapis.com/gweb-uniblog-publish-prod/images/gemini_4_cyber_evals_gray_swan_i.width-1200.format-webp.webp

1% · raw 1 %

Alternative · unknown effort · Own vendor

Source/record date: 2026-10-07

Anthropic Haiku 5.5 system card, p. 50. Q1+Q2 2026 IPI suite; probability attacker succeeds in k attempts; extended thinking, no product-specific prompt-injection protections. Do not mix with older challenge sets. Gemini/Kimi effort unspecified. Alternative evidence; existing headline/configuration retained. No averaging.

https://www-cdn.anthropic.com/e1080d6bf5ae2018ea3c2f414064be03232f5be5/Claude%20Haiku%205.5%20System%20Card.pdf#page=50
Claude Sonnet 5.5AnthropicAnthropic3.4%2026-10-07
All 1 recorded result & sources

3.4% · raw 3.4 %

Headline · unknown effort · Own vendor

Source/record date: 2026-10-07

Anthropic Haiku 5.5 system card, p. 50. Q1+Q2 2026 IPI suite; probability attacker succeeds in k attempts; extended thinking, no product-specific prompt-injection protections. Do not mix with older challenge sets. Gemini/Kimi effort unspecified.

https://www-cdn.anthropic.com/e1080d6bf5ae2018ea3c2f414064be03232f5be5/Claude%20Haiku%205.5%20System%20Card.pdf#page=50
Gemini 3.8 FlashGoogleGoogle5.5%2026-09-30
All 2 recorded results & sources

5.5% · raw 5.5 %

Headline · unknown effort · Peer vendor

Source/record date: 2026-09-30

As reported by Google Gemini 4 Argon Gray Swan chart (K=15 attack success rate)

https://storage.googleapis.com/gweb-uniblog-publish-prod/images/gemini_4_cyber_evals_gray_swan_i.width-1200.format-webp.webp

5.5% · raw 5.5 %

Alternative · unknown effort · Peer vendor

Source/record date: 2026-10-07

Anthropic Haiku 5.5 system card, p. 50. Q1+Q2 2026 IPI suite; probability attacker succeeds in k attempts; extended thinking, no product-specific prompt-injection protections. Do not mix with older challenge sets. Gemini/Kimi effort unspecified. Alternative evidence; existing headline/configuration retained. No averaging.

https://www-cdn.anthropic.com/e1080d6bf5ae2018ea3c2f414064be03232f5be5/Claude%20Haiku%205.5%20System%20Card.pdf#page=50
Claude Haiku 5.5AnthropicAnthropic7.1%2026-10-07
All 1 recorded result & sources

7.1% · raw 7.1 %

Headline · unknown effort · Own vendor

Source/record date: 2026-10-07

Anthropic Haiku 5.5 system card, p. 50. Q1+Q2 2026 IPI suite; probability attacker succeeds in k attempts; extended thinking, no product-specific prompt-injection protections. Do not mix with older challenge sets. Gemini/Kimi effort unspecified.

https://www-cdn.anthropic.com/e1080d6bf5ae2018ea3c2f414064be03232f5be5/Claude%20Haiku%205.5%20System%20Card.pdf#page=50
GPT-6 AstraOpenAIOpenAI8.5%2026-09-30
All 1 recorded result & sources

8.5% · raw 8.5 %

Headline · unknown effort · Peer vendor

Source/record date: 2026-09-30

As reported by Google Gemini 4 Argon chart; peer harness notes in Google eval methodology

https://storage.googleapis.com/gweb-uniblog-publish-prod/images/gemini_4_cyber_evals_gray_swan_i.width-1200.format-webp.webp
Muse Spark 1.3MetaMeta15.9%2026-09-30
All 1 recorded result & sources

15.9% · raw 15.9 %

Headline · unknown effort · Peer vendor

Source/record date: 2026-09-30

As reported by Google Gemini 4 Argon Gray Swan chart (K=15 attack success rate)

https://storage.googleapis.com/gweb-uniblog-publish-prod/images/gemini_4_cyber_evals_gray_swan_i.width-1200.format-webp.webp
GPT-6 LunaOpenAIOpenAI28.7%2026-10-07
All 1 recorded result & sources

28.7% · raw 28.7 %

Headline · unknown effort · Peer vendor

Source/record date: 2026-10-07

Anthropic Haiku 5.5 system card, p. 50. Q1+Q2 2026 IPI suite; probability attacker succeeds in k attempts; extended thinking, no product-specific prompt-injection protections. Do not mix with older challenge sets. Gemini/Kimi effort unspecified.

https://www-cdn.anthropic.com/e1080d6bf5ae2018ea3c2f414064be03232f5be5/Claude%20Haiku%205.5%20System%20Card.pdf#page=50
GLM-5.3Z.aiZ.ai31.5%2026-09-30
All 1 recorded result & sources

31.5% · raw 31.5 %

Headline · unknown effort · Peer vendor

Source/record date: 2026-09-30

As reported by Google Gemini 4 Argon Gray Swan chart (K=15 attack success rate)

https://storage.googleapis.com/gweb-uniblog-publish-prod/images/gemini_4_cyber_evals_gray_swan_i.width-1200.format-webp.webp
Kimi K3Moonshot AIMoonshot AI52.7%2026-09-30
All 2 recorded results & sources

52.7% · raw 52.7 %

Headline · unknown effort · Peer vendor

Source/record date: 2026-09-30

As reported by Google Gemini 4 Argon Gray Swan chart (K=15 attack success rate)

https://storage.googleapis.com/gweb-uniblog-publish-prod/images/gemini_4_cyber_evals_gray_swan_i.width-1200.format-webp.webp

52.7% · raw 52.7 %

Alternative · unknown effort · Peer vendor

Source/record date: 2026-10-07

Anthropic Haiku 5.5 system card, p. 50. Q1+Q2 2026 IPI suite; probability attacker succeeds in k attempts; extended thinking, no product-specific prompt-injection protections. Do not mix with older challenge sets. Gemini/Kimi effort unspecified. Alternative evidence; existing headline/configuration retained. No averaging.

https://www-cdn.anthropic.com/e1080d6bf5ae2018ea3c2f414064be03232f5be5/Claude%20Haiku%205.5%20System%20Card.pdf#page=50
BeamReflection AIReflection AI——No recorded result
DeepSeek V4.1 FlashDeepSeekDeepSeek——No recorded result
GLM-5.3-FlashZ.aiZ.ai——No recorded result
GPT-5.6 TerraOpenAIOpenAI——No recorded result
GPT-6.1 SolOpenAIOpenAI——No recorded result
Grok 4.7xAIxAI——No recorded result
Hy4 previewTencentTencent——No recorded result
Kolibri-1Aleph AlphaAleph Alpha——No recorded result
Ling 3.0 Flash VLinclusionAIinclusionAI——No recorded result
Ling 3.1 FlashinclusionAIinclusionAI——No recorded result
Mercury 2.5InceptionInception——No recorded result
MiMo-V2.6-Distill-Qwen-9BXiaomiXiaomi——No recorded result
MiMo-V2.6-FlashXiaomiXiaomi——No recorded result
MiMo-V2.6-ProXiaomiXiaomi——No recorded result
Mistral Large 4Mistral AIMistral AI——No recorded result
Naive-N0.5-FlashNaiveAINaiveAI——No recorded result
Nex-N2.5-ProNex AGINex AGI——No recorded result
Pareto 26.10 PreviewUnbiasedUnbiased——No recorded result
Qwen3.8 27BAlibaba (Qwen)Alibaba (Qwen)——No recorded result
Qwen3.8 FlashAlibaba (Qwen)Alibaba (Qwen)——No recorded result
Qwen3.8 Max (0902)Alibaba (Qwen)Alibaba (Qwen)——No recorded result
Qwen3.8 Omni FlashAlibaba (Qwen)Alibaba (Qwen)——No recorded result

Save benchmark

Collections are saved only in this browser.