中文

广义偏好强化学习

机器学习 2026-05-22 v3 计算与语言

摘要

后训练将大型语言模型(LLM)对齐划分为两个基本脱节的轨道。带有可验证奖励的在线强化学习(RL)推动了数学和代码领域的涌现推理能力,但依赖于无法触及开放式任务的程序化验证器;而偏好优化虽能处理开放式生成,却放弃了驱动在线 RL 的持续探索。弥合这一差距需要针对开放式质量的验证器,但标量奖励模型的形态并不适合这一任务。质量是多维度的,任何标量分数都是不完整的代理,会使在线 RL 坍缩至分数最敏感的单一维度上。我们转而采用广义偏好模型,将响应嵌入 kk 个斜对称子空间中,并将偏好表示为结构化且感知不可传递性的比较。在此基础上,我们提出广义偏好强化学习(GPRL),将这种 kk 维结构贯穿至策略更新中。GPRL 计算每个维度上的组相对优势,在各自尺度上进行归一化以防止单一维度占据主导,并利用上下文相关的特征值对其进行聚合。同样的结构驱动了一个闭环漂移监控器,可检测单维度剥削并通过重新加权各维度和收紧信赖域来实时纠正。从 Llama-3-8B-Instruct\texttt{Llama-3-8B-Instruct} 出发,GPRL 在 AlpacaEval~2.0 上达到了 56.51%56.51\% 的长度控制胜率,同时在 Arena-Hard、MT-Bench 和 WildBench 上也优于 SimPO 和 SPPO,这得益于其在延长训练周期中抵抗奖励欺骗的能力。

关键词

引用

@article{arxiv.2605.18721,
  title  = {General Preference Reinforcement Learning},
  author = {Muhammad Umer and Muhammad Ahmed Mohsin and Ahsan Bilal and Arslan Chaudhry and Andreas Haupt and Sanmi Koyejo and Emily Fox and John M. Cioffi},
  journal= {arXiv preprint arXiv:2605.18721},
  year   = {2026}
}