中文

面向强化学习人类反馈的 Wasserstein 分布鲁棒后悔优化

机器学习 2026-05-19 v2 计算与语言 最优化与控制 机器学习

摘要

强化学习从人类反馈(RLHF)已成为对大型语言模型对齐最关键的后训练步骤,但 RLHF 中使用的奖励信号仅是真实人类效用感的学习代理。从运营研究视角,这构成了一个在目标误估情况下的决策问题:策略针对估计的奖励进行优化,而部署性能由不可观测的目标决定。 resulting gap导致奖励过度优化,即Goodhart现象,其中代理奖励继续提高,即使真实质量恶化。现有缓解方法通过不确定性惩罚、悲观奖励或保守约束来处理,但可能计算负担沉重且过于悲观。我们提出 Wasserstein 分布鲁棒后悔优化(DRRO)用于 RLHF。DRRO 不如标准分布鲁棒优化(DRO)那样对最差情形价值进行悲观化,而是对同一可行奖励扰动下最优策略的后悔进行悲观化。我们通过单纯形分配模型研究 prompt 级问题,表明在 1\ell_1 地坪 Wasserstein 模糊集下,内层最差后悔可精确求解,最优策略具有水灌结构。这些结果导致一个实用的策略梯度算法,采用简单的采样奖金解释,仅需对 GRPO 风格 RLHF 训练进行少量修改。该框架也从理论上阐明了 DRRO 为何比 DRO 更不悲观,我们的实验表明 DRRO 在缓解过度优化方面比现有基线更有效,而标准 DRO 则系统性地过于悲观。

关键词

引用

@article{arxiv.2605.00155,
  title  = {Wasserstein Distributionally Robust Regret Optimization for Reinforcement Learning from Human Feedback},
  author = {Yikai Wang and Shang Liu and Jose Blanchet},
  journal= {arXiv preprint arXiv:2605.00155},
  year   = {2026}
}