揭示多目标对齐中的跨目标干扰
计算与语言
2026-05-07 v2 机器学习
摘要
我们研究了大语言模型 (LLM) 多目标对齐中持久存在的一种失效模式:训练仅提升部分目标的性能,却导致其他目标性能下降。我们将这一现象形式化为跨目标干扰,并系统性地研究了标量化算法,发现干扰普遍存在且具有显著的模型依赖性。为解释此现象,我们推导了局部协方差定律,表明当目标奖励与标量化得分呈正协方差时,该目标得以提升。我们扩展了该分析至现代对齐中使用的裁剪代理目标,证明即使在裁剪条件下,协方差定律仍然成立。基于此分析,我们提出协方差导向权重适应 (CTWA) 方法,通过维持目标奖励与训练信号之间的正协方差,有效缓解跨目标干扰。最后,我们补充了全局收敛分析(基于 Polyak-\L{}ojasiewicz 条件),阐明非凸标量化优化何时实现全局收敛,以及跨目标干扰如何依赖于特定模型几何属性。
引用
@article{arxiv.2602.06869,
title = {Uncovering Cross-Objective Interference in Multi-Objective Alignment},
author = {Yining Lu and Meng Jiang},
journal= {arXiv preprint arXiv:2602.06869},
year = {2026}
}