中文

层级自暴露与修补:用于越狱攻击防御的肯定性 Token 缓解

密码学与安全 2025-02-13 v2 人工智能 计算与语言

摘要

随着大型语言模型日益广泛地部署于聊天机器人助手和代码生成等多种应用中,使其行为符合安全与伦理标准变得至关重要。然而,越狱攻击利用漏洞诱使模型产生非预期或有害输出,严重威胁 LLM 的安全性。在本文中,我们引入了 Layer-AdvPatcher,这是一种新颖的方法,旨在通过自我增强数据集利用遗忘策略来修补 LLM 中的特定层,从而防御越狱攻击。我们的洞察在于,某些层在面对有害提示时倾向于产生肯定性 token。通过识别这些层并对抗性地暴露它们以生成更多有害数据,可以理解它们对攻击固有的、多样的漏洞。基于这些暴露,我们随后“遗忘”这些问题,减少肯定性 token 的影响,从而在保持模型对安全查询的响应不变的同时,将越狱风险降至最低。我们在两个模型、四个基准数据集和多种最先进的越狱攻击上进行了大量实验,以证明我们方法的有效性。结果表明,与近期的防御方法相比,我们的框架在不损害良性查询效用的前提下,降低了越狱攻击的危害性和攻击成功率。我们的代码公开发布于:https://github.com/oyy2000/LayerAdvPatcher

关键词

引用

@article{arxiv.2501.02629,
  title  = {Layer-Level Self-Exposure and Patch: Affirmative Token Mitigation for Jailbreak Attack Defense},
  author = {Yang Ouyang and Hengrui Gu and Shuhang Lin and Wenyue Hua and Jie Peng and Bhavya Kailkhura and Meijun Gao and Tianlong Chen and Kaixiong Zhou},
  journal= {arXiv preprint arXiv:2501.02629},
  year   = {2025}
}

备注

14 pages, 4 figures, conference