中文

Gandalf the Red:面向 LLM 的自适应安全

机器学习 2025-08-05 v3 人工智能 计算与语言 密码学与安全

摘要

当前对大语言模型(LLM)应用中抗 prompt 攻击防御的评估往往忽视两个关键因素:对抗行为的动态性以及限制性防御对合法用户的可用性惩罚。我们提出 D-SEC(动态安全效用威胁模型),其明确区分攻击者与合法用户,建模多步骤交互,并以可优化形式表达安全-效用。我们进一步通过引入 Gandalf,一个以众包、游戏化红队测试平台设计,用于生成真实、自适应的攻击。使用 Gandalf,我们收集并公开了 279k 条 prompt 攻击数据集。结合良性用户数据,我们的分析揭示了安全性和可用性之间的相互作用,表明集成在 LLM 中的防御措施(如系统提示词)即使不阻止请求,也会降低可用性。我们展示了受限应用领域、深度防御和自适应防御是构建安全且实用 LLM 应用的有效策略。

关键词

引用

@article{arxiv.2501.07927,
  title  = {Gandalf the Red: Adaptive Security for LLMs},
  author = {Niklas Pfister and Václav Volhejn and Manuel Knott and Santiago Arias and Julia Bazińska and Mykhailo Bichurin and Alan Commike and Janet Darling and Peter Dienes and Matthew Fiedler and David Haber and Matthias Kraft and Marco Lancini and Max Mathys and Damián Pascual-Ortiz and Jakub Podolak and Adrià Romero-López and Kyriacos Shiarlis and Andreas Signer and Zsolt Terek and Athanasios Theocharis and Daniel Timbrell and Samuel Trautwein and Samuel Watts and Yun-Han Wu and Mateo Rojas-Carulla},
  journal= {arXiv preprint arXiv:2501.07927},
  year   = {2025}
}

备注

Niklas Pfister, V\'aclav Volhejn and Manuel Knott contributed equally