中文

LLMail-Inject:来自真实自适应提示注入挑战的数据集

密码学与安全 2025-06-12 v1 人工智能

摘要

间接提示注入攻击利用了大型语言模型(LLM)在区分输入中的指令与数据方面的固有局限性。尽管已有众多防御方案提出,但针对自适应对抗者的系统性评估仍然有限,即使成功的攻击可能带来广泛的安全和隐私影响,且许多现实中的LLM应用仍然存在漏洞。我们展示了LLMail-Inject的结果,这是一项公开挑战,模拟了一个真实场景,参与者自适应地尝试将恶意指令注入电子邮件,以触发LLM邮件助手中的未授权工具调用。该挑战涵盖了多种防御策略、LLM架构和检索配置,最终形成了一个包含839名参与者提交的208,095条独特攻击记录的数据集。我们发布了挑战代码、完整的提交数据集以及我们的分析,展示了这些数据如何为指令-数据分离问题提供新的见解。我们希望这能成为未来研究朝着提示注入的实用结构性解决方案迈进的基石。

关键词

引用

@article{arxiv.2506.09956,
  title  = {LLMail-Inject: A Dataset from a Realistic Adaptive Prompt Injection Challenge},
  author = {Sahar Abdelnabi and Aideen Fay and Ahmed Salem and Egor Zverev and Kai-Chieh Liao and Chi-Huang Liu and Chun-Chih Kuo and Jannis Weigend and Danyael Manlangit and Alex Apostolov and Haris Umair and João Donato and Masayuki Kawakita and Athar Mahboob and Tran Huu Bach and Tsun-Han Chiang and Myeongjin Cho and Hajin Choi and Byeonghyeon Kim and Hyeonjin Lee and Benjamin Pannell and Conor McCauley and Mark Russinovich and Andrew Paverd and Giovanni Cherubin},
  journal= {arXiv preprint arXiv:2506.09956},
  year   = {2025}
}

备注

Dataset at: https://huggingface.co/datasets/microsoft/llmail-inject-challenge