中文

SafeAligner:基于响应差异指导的越狱攻击安全对齐

密码学与安全 2024-12-25 v4 计算与语言

摘要

随着大语言模型(LLM)开发的快速进展,有效地在不损害其实用性方面确保这些模型安全已成为关键研究领域。然而,当前针对越狱攻击(即规避安全协议的尝试)的防御策略常常受限于适应性、通用能力受限和高成本。为解决这些挑战,我们引入SafeAligner,这是一种在解码阶段实现的 methodology,以增强对越狱攻击的防御。我们首先开发了两个专门模型:培养安全性的哨兵模型,以及设计来生成更高风险响应的侵入者模型。SafeAligner利用这些模型之间响应安全性水平的差异,以区分有害和有益的标记,有效地通过改变目标模型的输出标记分布来指导安全对齐。大量实验表明,SafeAligner能够增加有益标记的可能性,同时减少有害标记的发生,从而以最小程度的损失确保安全对齐。

关键词

引用

@article{arxiv.2406.18118,
  title  = {SafeAligner: Safety Alignment against Jailbreak Attacks via Response Disparity Guidance},
  author = {Caishuang Huang and Wanxu Zhao and Rui Zheng and Huijie Lv and Wenyu Zhan and Shihan Dou and Sixian Li and Xiao Wang and Enyu Zhou and Junjie Ye and Yuming Yang and Tao Gui and Qi Zhang and Xuanjing Huang},
  journal= {arXiv preprint arXiv:2406.18118},
  year   = {2024}
}