中文

安全对齐应不止是仅靠几个注意力头

密码学与安全 2025-08-28 v1 人工智能 计算与语言

摘要

当前大语言模型(LLM)的安全对齐机制仍存在漏洞,由于对抗性提示可以有效绕过其安全措施。我们的调查发现,这些安全机制主要依赖于有限的注意力头子集:移除或消融这些头会严重削弱模型的安全性。为识别和评估这些安全关键组件,我们引入了 RDSHA(识别依赖注意力头的安全方法),该方法利用模型的拒绝方向来定位最负责任于安全行为的注意力头。进一步分析表明,现有的越狱攻击利用了这种集中,通过选择性绕过或操纵这些关键注意力头来实施。为解决此问题,我们提出了 AHD(注意力头分布训练策略),这是一种旨在促进安全相关行为在众多注意力头之间分布编码的新型训练方法。实验结果表明,AHD 成功地将安全相关能力分布到更多注意力头上。此外,在几种主流越狱攻击下的评估显示,采用 AHD 训练的模型在安全鲁棒性方面表现显著提升,而整体功能效用保持稳定。

关键词

引用

@article{arxiv.2508.19697,
  title  = {Safety Alignment Should Be Made More Than Just A Few Attention Heads},
  author = {Chao Huang and Zefeng Zhang and Juewei Yue and Quangang Li and Chuang Zhang and Tingwen Liu},
  journal= {arXiv preprint arXiv:2508.19697},
  year   = {2025}
}