中文

OrthAlign:用于非干扰多目标对齐的正交子空间分解

机器学习 2025-10-01 v2 计算与语言

摘要

大语言模型(LLM)对齐面临在处理多个人类偏好时的严重困境:一个维度的改进往往以牺牲其他维度为代价,导致有帮助性、无害性等竞争目标之间不可避免的权衡。虽然先前工作主要关注约束式优化算法和数据选择策略以缓解冲突,但这些方法忽视了在参数层面直接解决冲突的根本问题。本文提出 OrthAlign,一种创新方法,开创了一种新范式,通过正交子空间分解从根本上解决多目标偏好对齐中梯度层面的冲突。OrthAlign 战略性地将参数更新空间分解为正交子空间,确保针对不同偏好的优化在数学上非干扰方向上进行。基于此,我们提供了理论保证,表明当参数增量满足正交子空间约束和谱范数界限时,所得更新在线性 Lipschitz 增长而非指数级不稳定性方面具有稳定收敛性,适用于所有偏好维度。大量实验表明:I. OrthAlign 在帮助、无害和真实等维度上实现了 34.61% 至 50.89% 的最大单偏好改进。II. 平均整体奖励提升 13.96%。

关键词

引用

@article{arxiv.2509.24610,
  title  = {OrthAlign: Orthogonal Subspace Decomposition for Non-Interfering Multi-Objective Alignment},
  author = {Liang Lin and Zhihao Xu and Junhao Dong and Jian Zhao and Yuchen Yuan and Guibin Zhang and Miao Yu and Yiming Zhang and Zhengtao Yao and Huahui Yi and Dongrui Liu and Xinfeng Li and Kun Wang},
  journal= {arXiv preprint arXiv:2509.24610},
  year   = {2025}
}