中文

SABER:通过跨层残差连接揭示安全对齐中的漏洞

机器学习 2025-09-22 v1 计算与语言

摘要

经过安全对齐训练的大型语言模型(LLM)是具备强大语言理解能力的有力工具。这些模型通常经过精细的对齐流程,结合人类反馈以确保接受安全输入并拒绝有害或不安全的输入。然而,尽管具有庞大的规模和对齐努力,LLM 仍然容易受到越狱攻击,恶意用户会操纵模型产生其被明确训练去避免的有害输出。在本研究中,我们发现 LLM 的安全机制主要嵌入在中后期层中。基于这一洞察,我们提出了一种新型白盒越狱方法 SABER(通过额外残差绕过安全对齐,Safety Alignment Bypass via Extra Residuals),该方法通过残差连接将两个中间层 ssee(满足 s<es < e)连接起来。我们的方法在 HarmBench 测试集上比性能最佳的基线提高了 51%。此外,在 HarmBench 验证集上评估时,SABER 仅引起困惑度的微小变化。源代码公开于 https://github.com/PalGitts/SABER。

关键词

引用

@article{arxiv.2509.16060,
  title  = {SABER: Uncovering Vulnerabilities in Safety Alignment via Cross-Layer Residual Connection},
  author = {Maithili Joshi and Palash Nandi and Tanmoy Chakraborty},
  journal= {arXiv preprint arXiv:2509.16060},
  year   = {2025}
}

备注

Accepted in EMNLP'25 Main