理解并保持微调大语言模型中的安全性
机器学习
2026-01-16 v1 人工智能
摘要
微调是将大语言模型(LLM)应用于下游任务的一项基本且普遍的功能。然而,它有可能大幅降低安全对齐,例如,即使微调数据完全无害,也会大大增加对越狱攻击的敏感性。尽管在微调阶段的防御工作引起了越来越多的关注,但现有方法仍难以解决持续存在的安全-效用困境:强调安全性会损害任务性能,而优先考虑效用通常需要深度微调,这不可避免地导致安全性的急剧下降。在这项工作中,我们通过揭示安全对齐LLM中安全导向和效用导向梯度之间的几何相互作用来解决这一困境。通过系统的实证分析,我们发现了三个关键见解:(I)安全梯度位于低秩子空间中,而效用梯度跨越更广泛的高维空间;(II)这些子空间通常呈负相关,导致微调期间的梯度方向冲突;(III)可以从单个样本中有效估计主导的安全方向。基于这些新颖的见解,我们提出了安全保持微调(SPF),一种轻量级方法,明确移除与低秩安全子空间冲突的梯度分量。理论上,我们证明SPF在限制安全漂移的同时保证了效用收敛。实证上,SPF持续保持下游任务性能,并几乎恢复了所有预训练的安全对齐,即使在对抗性微调场景下也是如此。此外,SPF对深度微调和动态越狱攻击都表现出强大的抵抗力。总之,我们的发现为始终对齐的LLM微调提供了新的机制理解和实践指导。
引用
@article{arxiv.2601.10141,
title = {Understanding and Preserving Safety in Fine-Tuned LLMs},
author = {Jiawen Zhang and Yangfan Hu and Kejia Chen and Lipeng He and Jiachen Ma and Jian Lou and Dan Li and Jian Liu and Xiaohu Yang and Ruoxi Jia},
journal= {arXiv preprint arXiv:2601.10141},
year = {2026}
}