手术:通过注意力沉底缓解大语言模型有害微调
人工智能
2026-02-12 v2
摘要
有害微调会使大语言模型的安全对齐失效,暴露出显著的安全风险。本文我们利用注意力沉底机制来缓解有害微调。具体而言,我们首先测量每个注意力头的名为 \emph{sink divergence} 的统计量,并观察到 \emph{不同的注意力头呈现两种不同的沉底发散符号}。为理解其安全影响,我们进行实验发现,随着模型在进行有害微调后其有害性的增加,正向沉底发散注意力头的数量也随之增加。基于这一发现,我们提出一种可分离的沉底发散假设——\emph{在微调期间与学习有害模式相关的注意力头可以通过其沉底发散符号进行可分离}。基于此假设,我们提出一种微调阶段的防御方法,称为手术 (Surgery)。手术利用沉底发散正则化器进行抑制,使注意力头趋向于负向沉底发散组,从而减少模型学习和放大有害模式的倾向。广泛的实验表明,手术在 BeaverTails、HarmBench 和 SorryBench 基准测试中分别将防御性能提升了 5.90%、11.25% 和 9.55%。源代码已在 https://github.com/Lslland/Surgery 上提供。
引用
@article{arxiv.2602.05228,
title = {Surgery: Mitigating Harmful Fine-Tuning for Large Language Models via Attention Sink},
author = {Guozhi Liu and Weiwei Lin and Tiansheng Huang and Ruichao Mo and Qi Mu and Xiumin Wang and Li Shen},
journal= {arXiv preprint arXiv:2602.05228},
year = {2026}
}