中文

通过排序均方误差进行奖励学习

机器学习 2026-01-16 v2 人工智能

摘要

奖励设计仍然是将强化学习(RL)应用于现实世界问题的重大瓶颈。一种流行的替代方案是奖励学习,即从人类反馈中推断奖励函数,而非手动指定。最近的工作提出从以评分形式而非传统二元偏好形式出现的人类反馈中学习奖励函数,从而实现更丰富且潜在认知负担更低的监督。基于这一范式,我们引入了一种新的基于评分的RL方法——用于RL的排序回报回归(R4)。R4的核心是采用了一种新颖的排序均方误差(rMSE)损失,将教师提供的评分视为有序目标。我们的方法从轨迹-评分对的数据集中学习,其中每条轨迹都带有一个离散的评分标签(例如,“差”、“中性”、“好”)。在每个训练步骤中,我们采样一组轨迹,预测它们的回报,并使用可微排序算子(软排序)对它们进行排序。然后,我们优化所得软排序与教师评分之间的均方误差损失。与以往的基于评分的方法不同,R4提供了形式化保证:在温和的假设下,其解集可证明是极小且完备的。在实验中,我们使用模拟的人类反馈证明,在OpenAI Gym和DeepMind Control Suite的机器人运动基准上,R4始终匹配或优于现有的基于评分和基于偏好的RL方法,同时所需的反馈显著减少。

关键词

引用

@article{arxiv.2601.09236,
  title  = {Reward Learning through Ranking Mean Squared Error},
  author = {Chaitanya Kharyal and Calarina Muslimani and Matthew E. Taylor},
  journal= {arXiv preprint arXiv:2601.09236},
  year   = {2026}
}