中文

通过监督学习的隐式离线强化学习

机器学习 2022-10-25 v1 机器学习 机器人学

摘要

通过监督学习的离线强化学习(RL)是一种从由不同专业水平策略收集的数据集中学习机器人技能的简便有效方法。它如同监督学习与行为克隆(BC)一样简单,但利用了回报信息。在由相似专业水平策略收集的数据集上,隐式 BC 已被证明可匹敌或优于显式 BC。尽管使用隐式模型通过 BC 学习机器人技能有益,通过监督学习的离线 RL 算法一直局限于显式模型。我们展示了隐式模型如何利用回报信息,并匹敌或优于显式算法以从固定数据集获取机器人技能。此外,我们展示了我们的隐式方法与其他流行的通过监督学习的 RL 算法之间的紧密关系,以提供统一框架。最后,我们在高维操作与运动任务上证明了方法的有效性。

关键词

引用

@article{arxiv.2210.12272,
  title  = {Implicit Offline Reinforcement Learning via Supervised Learning},
  author = {Alexandre Piche and Rafael Pardinas and David Vazquez and Igor Mordatch and Chris Pal},
  journal= {arXiv preprint arXiv:2210.12272},
  year   = {2022}
}