锚定拒绝方向:通过投影约束缓解微调中的安全风险
计算与语言
2025-09-09 v1
摘要
指令微调(Instruction Fine-Tuning, IFT)已被广泛采用作为一种有效的后训练策略,以增强大型语言模型(LLM)的各种能力。然而,先前的研究表明,IFT会显著损害LLM的安全性,特别是其拒绝恶意指令的能力,这引发了重大关切。最近对LLM内部机制的研究在隐藏状态中识别出了拒绝方向(r-direction),它在控制拒绝行为中起着关键作用。基于这一见解,我们的研究揭示,r-direction在训练过程中往往会发生漂移,我们认为这是相关安全风险的原因之一。为了缓解这种漂移,我们提出的ProCon方法引入了一个投影约束损失项,用于正则化每个训练样本的隐藏状态在r-direction上的投影幅度。我们的初步分析表明,施加适当的约束可以有效缓解拒绝方向的漂移及其相关的安全风险,但仍受到整体性能瓶颈的限制。为了克服这一瓶颈,基于我们对早期剧烈漂移的观察和数据驱动的视角,我们引入了一种预热策略,强调早期的强约束并拓宽数据分布以增强约束信号,从而形成了一种增强的ProCon方法。在各种数据集、场景和LLM下的实验结果表明,我们的方法能够在保持任务性能提升的同时,显著缓解IFT带来的安全风险。即使与强基线相比,我们的方法也能持续提供更优的整体性能。关键在于,我们的分析表明ProCon有助于在训练过程中稳定r-direction,而这种由可解释性驱动的对LLM内部机制的探索为未来的安全研究奠定了坚实的基础。
引用
@article{arxiv.2509.06795,
title = {Anchoring Refusal Direction: Mitigating Safety Risks in Tuning via Projection Constraint},
author = {Yanrui Du and Fenglei Fan and Sendong Zhao and Jiawei Cao and Qika Lin and Kai He and Ting Liu and Bing Qin and Mengling Feng},
journal= {arXiv preprint arXiv:2509.06795},
year = {2025}
}