潜在对抗训练提升拒绝表示
计算与语言
2025-04-29 v1 机器学习
摘要
最近的研究表明,语言模型的拒绝行为主要编码在其潜在空间的单个方向上,使其对针对性攻击极其脆弱。尽管潜在对抗训练 (LAT) 通过在训练时引入噪声来提高鲁棒性,但关键问题仍悬而未决:这种基于噪声的训练如何影响拒绝行为的底层表示?理解这种编码对于评估 LAT 的有效性和局限性至关重要,正如发现线性拒绝方向揭示了传统监督安全微调 (SSFT) 漏洞的那样。通过对 Llama 2 7B 的分析,我们检查了 LAT 如何重新组织模型潜在空间中拒绝行为的表示,与 SSFT 和嵌入空间对抗训练 (AT) 进行比较。通过计算有害与无害指令对之间的激活差异并应用奇异值分解 (SVD),我们发现 LAT 显著改变了拒绝表示,将其集中在前两个 SVD 成分中,这些成分解释了约 75% 的激活差异方差——显著高于参考模型。这种集中表示导致更有效和可迁移的拒绝向量用于消除攻击:LAT 模型在使用来自参考模型的向量攻击时表现出更好的鲁棒性,但与 SSFT 和 AT 相比,对自生成向量更为脆弱。我们的发现表明,LAT 的训练扰动能够更全面地表示拒绝行为,凸显了其在提高模型安全方面的潜在优势和局限性。
引用
@article{arxiv.2504.18872,
title = {Latent Adversarial Training Improves the Representation of Refusal},
author = {Alexandra Abbas and Nora Petrova and Helios Ael Lyons and Natalia Perez-Campanero},
journal= {arXiv preprint arXiv:2504.18872},
year = {2025}
}