SABER:通过跨层残差连接揭示安全对齐中的漏洞
机器学习
2025-09-22 v1 计算与语言
摘要
经过安全对齐训练的大型语言模型(LLM)是具备强大语言理解能力的有力工具。这些模型通常经过精细的对齐流程,结合人类反馈以确保接受安全输入并拒绝有害或不安全的输入。然而,尽管具有庞大的规模和对齐努力,LLM 仍然容易受到越狱攻击,恶意用户会操纵模型产生其被明确训练去避免的有害输出。在本研究中,我们发现 LLM 的安全机制主要嵌入在中后期层中。基于这一洞察,我们提出了一种新型白盒越狱方法 SABER(通过额外残差绕过安全对齐,Safety Alignment Bypass via Extra Residuals),该方法通过残差连接将两个中间层 和 (满足 )连接起来。我们的方法在 HarmBench 测试集上比性能最佳的基线提高了 51%。此外,在 HarmBench 验证集上评估时,SABER 仅引起困惑度的微小变化。源代码公开于 https://github.com/PalGitts/SABER。
引用
@article{arxiv.2509.16060,
title = {SABER: Uncovering Vulnerabilities in Safety Alignment via Cross-Layer Residual Connection},
author = {Maithili Joshi and Palash Nandi and Tanmoy Chakraborty},
journal= {arXiv preprint arXiv:2509.16060},
year = {2025}
}
备注
Accepted in EMNLP'25 Main