中文

DETAM:通过定向注意力修改防御 LLM 对越狱攻击

计算与语言 2025-04-21 v1

摘要

随着大型语言模型(LLM)的广泛采用,越狱攻击已成为日益突出的安全 concern。虽然安全对齐的 LLM 能有效防御正常的有害查询,但它们仍对此类攻击保持脆弱性。现有的防御方法主要依赖微调或输入修改,往往 suffer from 局部化和降低实用性。为此,我们引入 DETAM,一种无需微调的防御方法,通过定向注意力修改提升 LLM 对越狱攻击的防御能力。具体而言,我们分析成功防御与失败防御之间注意力得分的差异,以识别对越狱攻击敏感的注意力头。在推理过程中,我们重新分配注意力以强调用户的核心意图,最小化来自攻击标记的干扰。我们的实验结果表明,DETAM 在越狱防御方面优于各种基线方法,并在不同攻击和模型之间展现出稳健的泛化能力,即使在野生越狱数据上也能保持有效性。此外,在评估模型实用性时,我们引入了过度防御数据集,进一步验证了我们方法的优越性能。代码将在接受后立即发布。

关键词

引用

@article{arxiv.2504.13562,
  title  = {DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification},
  author = {Yu Li and Han Jiang and Zhihua Wei},
  journal= {arXiv preprint arXiv:2504.13562},
  year   = {2025}
}