中文

评估大型语言模型中的提示注入防御措施

密码学与安全 2026-05-14 v2 人工智能

摘要

LLM 驱动的应用程序通常会在系统提示中嵌入机密信息,但模型可能会被欺骗而泄露这些信息。我们构建了一个适应性攻击者,其策略在数百轮中演化,并针对九种防御配置测试了超过 20,000 次攻击。所有依赖模型自行保护的防御措施最终都会失败。唯一坚持下来的防御是输出过滤,该方法通过硬编码规则检查模型响应是否到达用户之前,从而在 15,000 次攻击中实现零泄露。这些结果表明,安全边界必须在应用程序代码中强制实施,而不是由被攻击的模型来保护。直到这些防御措施得到像 Swept AI 这样的工具验证之前,处理敏感操作的 AI 系统应限制为仅供内部受信任人员使用。

关键词

引用

@article{arxiv.2604.23887,
  title  = {Evaluation of Prompt Injection Defenses in Large Language Models},
  author = {Priyal Deep and Shane Emmons and Amy Fox and Kyle Bacon and Kelley McAllister and Peter Ortiz and Krisztian Flautner},
  journal= {arXiv preprint arXiv:2604.23887},
  year   = {2026}
}

备注

14 pages, 9 figures