利用零空间约束策略优化缓解安全对齐税
机器学习
2026-02-02 v2
摘要
随着大型语言模型(LLM)日益广泛应用于实际场景,确保其行为符合人类价值观、社会规范和伦理原则至关重要。然而,强化学习(RL)下的安全对齐常常会导致模型遗忘已习得的通用能力,这也被称为对齐税。为解决此问题,我们提出了零空间约束策略优化(NSPO),这是一种新颖的 RL 框架,旨在对齐 LLM 安全性的同时保持其核心能力。安全策略梯度被几何投影至通用任务的零空间中,从而缓解安全对齐税。此外,我们在理论上证明了 NSPO 能够保持模型原有的核心能力,同时仍保证有效安全对齐的下降方向。大量实验表明,NSPO 大幅优于现有方法,在不牺牲通用任务(包括数学、代码和指令遵循任务)准确率的情况下,实现了最先进的安全性能。值得注意的是,NSPO 具有数据高效性,仅需使用 PKU-SafeRLHF 中 40% 的公开人工标注安全数据即可获得极具前景的安全性能,而无需现有对齐方法中使用的大量混合通用任务数据。
引用
@article{arxiv.2512.11391,
title = {Mitigating the Safety Alignment Tax with Null-Space Constrained Policy Optimization},
author = {Yifan Niu and Han Xiao and Dongyi Liu and Nuo Chen and Jia Li},
journal= {arXiv preprint arXiv:2512.11391},
year = {2026}
}
备注
accepted by ICLR 2026