中文

传递性与循环性:动态大语言模型对齐的显式偏好分解

计算与语言 2026-05-19 v1 人工智能

摘要

标准RLHF依赖传递性标量奖励,无法捕捉人类偏好的循环性。虽然如General Preference Model(GPM)等方法试图解决此问题,但我们发现其隐式表述将层级结构与循环性 entanglement,无法保证支配解。为此,我们提出Hybrid Reward-Cyclic(HRC)模型,利用博弈论分解显式地将偏好解耦为正交的传递性(标量)和循环性(向量)组成部分。我们还引入Dynamic Self-Play Preference Optimization(DSPPO),将对齐视为时变博弈,以逐步引导策略趋向纳什均衡。合成数据实验进一步验证HRC在混合传递-循环场景中的结构优势,其中HRC的收敛速度更快、准确率更高。在RewardBench 2上的实验表明,HRC持续优于BT和GPM基线(例如在Gemma-2B-it上提升1.23%)。尤其是在Ties领域的表现,证明了该模型在处理复杂非严格偏好方面的鲁棒性。广泛的下游评估在AlpacaEval 2.0、Arena-Hard-v0.1和MT-Bench上均确认了本框架的有效性。值得注意的是,当使用Gemma-2B-it作为基础偏好模型时,HRC+DSPPO在AlpacaEval 2.0上实现峰值长度控制胜率44.75%,在Arena-Hard-v0.1上达到46.8%,显著优于使用BT或GPM训练的SPPO基线。我们的代码已公开于 https://github.com/lab-klc/Hybrid-Reward-Cyclic。

关键词

引用

@article{arxiv.2605.17342,
  title  = {Transitivity Meets Cyclicity: Explicit Preference Decomposition for Dynamic Large Language Model Alignment},
  author = {Yucong Huang and Xiucheng Li and Kaiqi Zhao and Jing Li},
  journal= {arXiv preprint arXiv:2605.17342},
  year   = {2026}
}

备注

Accepted by ICML 2026