中文

当误差有益时:策略梯度中不完美奖励的分类

机器学习 2026-04-29 v1 人工智能 机器学习

摘要

通过强化学习训练语言模型通常依赖于不完美的代理奖励,因为精确定义目标行为的真实奖励很少可用。评估代理奖励质量的标准指标(如排序准确率)将错误奖励视为严格有害。然而,在本工作中,我们强调并非所有与真实奖励的偏差都是等同的。通过理论分析策略梯度优化期间哪些输出会吸引概率,我们根据奖励误差对真实奖励增加的影响对其进行了分类。分析表明,尽管奖励误差通常被视为有害的,但它也可能是良性的,甚至是有益的,因为它可以防止策略停滞在真实奖励平庸的输出周围。随后,我们提出了我们理论的两个实际推论。首先,对于基于人类反馈的强化学习 (RLHF),我们开发了考虑奖励误差有害性的奖励模型评估指标。与标准排序准确率相比,这些指标通常与 RLHF 后语言模型的性能相关性更好,但在稳健评估奖励模型方面仍存在差距。其次,我们为具有可验证奖励的环境中的奖励设计提供了见解。支撑我们结果的一个关键主题是,代理奖励函数的有效性在很大程度上取决于它与初始策略和学习算法的相互作用。

关键词

引用

@article{arxiv.2604.25872,
  title  = {When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient},
  author = {Shuning Shang and Hubert Strauss and Stanley Wei and Sanjeev Arora and Noam Razin},
  journal= {arXiv preprint arXiv:2604.25872},
  year   = {2026}
}

备注

Code available at https://github.com/princeton-pli/imperfect-rewards