中文

安全对齐作为持续学习:通过正交梯度投影缓解对齐税

机器学习 2026-05-13 v2 计算与语言

摘要

安全后训练可改善大型语言模型(LLM)的有害性和政策合规性,但也可能降低通用实用性,这一现象常被描述为“对齐税”。我们通过持续学习的视角研究这一权衡:顺序对齐阶段暴露模型于分布移位和目标变化的数据, Their gradients 可能干扰支撑先前获取的通用能力的方向。这种观点并不声称所有对齐退化都有单一原因;相反,它提供了缓解一个重要来源能力回归的有效一级机制。我们提出了正交梯度投影用于安全对齐(OGPSA),这是一种轻量级更新规则,通过对一小组通用能力数据上的梯度估计低秩参考子空间,并从每个安全梯度中移除位于该子空间内的分量。 resulting update 是在对参考目标的一阶约束下,使得每次更新都指向最陡的本地安全下降方向。OGPSA 兼容标准后训练管线,避免大规模重放,但引入了周期性参考梯度计算。在受监督微调(SFT)、直接偏好优化(DPO)以及顺序 SFT→DPO 设置下,OGPSA 在安全-实用性权衡上优于标准基线。 在顺序 SFT→DPO 管线下,Qwen2.5-7B-Instruct 的平均性能提升从 33.98% 提升至 42.74%,Llama3.1-8B-Instruct 从 19.74% 提升至 32.98%。我们已在 https://github.com/SunGL001/OGPSA 上开源代码。

关键词

引用

@article{arxiv.2602.07892,
  title  = {Safety Alignment as Continual Learning: Mitigating the Alignment Tax via Orthogonal Gradient Projection},
  author = {Guanglong Sun and Siyuan Zhang and Liyuan Wang and Jun Zhu and Hang Su and Yi Zhong},
  journal= {arXiv preprint arXiv:2602.07892},
  year   = {2026}
}