中文

AsFT:在狭窄安全盆地中进行 LLM 微调时的锚定安全措施

机器学习 2026-01-08 v3

摘要

对大型语言模型(LLM)进行微调可提升性能,但会引入关键安全漏洞:即使引入最小量的有害数据也会严重损害安全措施。我们观察到,与对齐方向(由对齐(安全)模型与未对齐模型之间的权重差异定义)垂直的扰动会迅速损害模型安全,而沿对齐方向的更新则基本保持安全,这揭示了参数空间是一个“狭窄安全盆地”。为此,我们提出了 AsFT(锚定安全微调)通过显式约束微调中的更新方向来维持安全。通过对对齐方向垂直的更新进行惩罚,AsFT 有效地将模型限制在“狭窄安全盆地”内,从而保留其内在安全性。实验在多个数据集和模型上表明,AsFT 可将有害行为降低最高 7.60%,提升任务性能 3.44%,并在多个任务中持续超越现有方法。

关键词

引用

@article{arxiv.2506.08473,
  title  = {AsFT: Anchoring Safety During LLM Fine-Tuning Within Narrow Safety Basin},
  author = {Shuo Yang and Qihui Zhang and Yuyang Liu and Xiaojun Jia and Kunpeng Ning and Jiayu Yao and Jigang Wang and Hailiang Dai and Yibing Song and Li Yuan},
  journal= {arXiv preprint arXiv:2506.08473},
  year   = {2026}
}