中文

超越奖励:离线偏好引导的策略优化

机器学习 2023-06-12 v2

摘要

本研究关注离线基于偏好的强化学习(PbRL),这是传统强化学习的一种变体,无需在线交互或奖励函数设定。相反,智能体被提供固定的离线轨迹以及成对轨迹间的人类偏好,分别用于提取动态与任务信息。由于动态与任务信息是正交的,一种朴素方法会使用基于偏好的奖励学习,随后接一个现成的离线 RL 算法。但这需要单独学习一个标量奖励函数,其被假定为学习过程的信息瓶颈。为解决此问题,我们提出离线偏好引导的策略优化(OPPO)范式,该范式以一步过程对离线轨迹与偏好建模,消除了单独学习奖励函数的需要。OPPO 通过引入用于优化上下文策略的离线后见信息匹配目标,以及用于寻找最优上下文的偏好建模目标来实现这一点。OPPO 进一步通过迭代优化两个目标来集成一个表现良好的决策策略。我们的实证结果表明,OPPO 有效建模离线偏好,并优于先前的竞争基线,包括基于真实或伪奖励函数设定的离线 RL 算法。我们的代码可在项目网站获取:https://sites.google.com/view/oppo-icml-2023 。

关键词

引用

@article{arxiv.2305.16217,
  title  = {Beyond Reward: Offline Preference-guided Policy Optimization},
  author = {Yachen Kang and Diyuan Shi and Jinxin Liu and Li He and Donglin Wang},
  journal= {arXiv preprint arXiv:2305.16217},
  year   = {2023}
}