中文

通过上下文对抗游戏防御越狱提示

机器学习 2025-02-25 v3 密码学与安全

摘要

大型语言模型 (LLM) 在多样化的应用中展现出卓越的能力。然而,对其安全性的担忧,特别是对越狱攻击的脆弱性,依然存在。受深度学习中对抗训练和 LLM 智能体学习过程的启发,我们引入了上下文对抗游戏 (In-Context Adversarial Game, ICAG),旨在无需微调即可防御越狱攻击。ICAG 利用智能体学习进行对抗游戏,旨在动态扩展知识以防御越狱。与依赖静态数据集的传统方法不同,ICAG 采用迭代过程来增强防御智能体和攻击智能体。这种持续改进的过程加强了对新生成的越狱提示的防御能力。我们的实证研究证实了 ICAG 的有效性,受 ICAG 保护的 LLM 在各种攻击场景下表现出显著降低的越狱成功率。此外,ICAG 展现出对其他 LLM 的显著迁移能力,表明其作为一种通用防御机制的潜力。

关键词

引用

@article{arxiv.2402.13148,
  title  = {Defending Jailbreak Prompts via In-Context Adversarial Game},
  author = {Yujun Zhou and Yufei Han and Haomin Zhuang and Kehan Guo and Zhenwen Liang and Hongyan Bao and Xiangliang Zhang},
  journal= {arXiv preprint arXiv:2402.13148},
  year   = {2025}
}

备注

EMNLP 2024 Main Paper