中文

MGDA-Decoupled:用于基于DPO的大语言模型对齐的几何感知多目标优化

机器学习 2026-04-23 v1

摘要

将大语言模型(LLM)与理想的人类价值观对齐需要平衡多个可能相互冲突的目标,如有帮助性、真实性和无害性,这带来了一个多目标优化的挑战。大多数对齐流程依赖于这些目标的固定标量化,这可能会通过系统性地低估更难优化或少数派目标而引入程序上的不公平性。为了促进更公平的权衡,我们引入了MGDA-Decoupled,这是一种基于几何的多目标优化算法,它在寻找共享下降方向的同时,明确考虑了每个目标的收敛动态。与依赖于强化学习(例如,GAPO)或显式奖励模型(例如,MODPO)的先前方法相比,我们的方法完全在轻量级的直接偏好优化(DPO)范式内运行。在UltraFeedback数据集上的实验表明,几何感知方法——尤其是MGDA-Decoupled——在整体和每个目标上,都实现了对黄金响应最高的胜率。

关键词

引用

@article{arxiv.2604.20685,
  title  = {MGDA-Decoupled: Geometry-Aware Multi-Objective Optimisation for DPO-based LLM Alignment},
  author = {Andor Vári-Kakas and Ji Won Park and Natasa Tagasovska},
  journal= {arXiv preprint arXiv:2604.20685},
  year   = {2026}
}

备注

Accepted to the Algorithmic Fairness Across Alignment Procedures and Agentic Systems Workshop at ICLR 2026