中文

二进制奖励标签:桥接离线偏好与基于奖励的强化学习

机器学习 2024-10-25 v3

摘要

离线强化学习已成为最实用的 RL 设置之一。然而,大多数现有工作关注标准设置,即基于标量奖励反馈,如何将现有丰富的离线 RL 理解从基于奖励的设置普遍转移到基于偏好的设置仍是未知的。本文提出了一个通用框架来填补这一差距。我们的关键洞察是通过二进制奖励标签(BRL)将偏好反馈转换为标量奖励,然后可以应用任何基于奖励的离线 RL 算法到带有奖励标签的数据集中。在实际学习情景中,二进制奖励标签可最小化反馈信号转换期间的信息损失。我们理论上展示了最近几个 PBRL 技术与我们的框架结合特定离线 RL 算法之间的联系。通过将奖励标签与不同算法结合,我们的框架可导致新的且可能更高效的离线 PBRL 算法。我们在基于标准 D4RL 基准的偏好数据集上进行经验测试。当与各种高效基于奖励的离线 RL 算法结合时,我们的框架在许多情况下实现的学习结果与在实际奖励数据集上训练的相同算法相当,并且在大多数情况下优于最近的 PBRL 基线。

关键词

引用

@article{arxiv.2406.10445,
  title  = {Binary Reward Labeling: Bridging Offline Preference and Reward-Based Reinforcement Learning},
  author = {Yinglun Xu and David Zhu and Rohan Gumaste and Gagandeep Singh},
  journal= {arXiv preprint arXiv:2406.10445},
  year   = {2024}
}