中文

基于真实数据源的现实世界离线强化学习

机器人学 2022-10-14 v1 机器学习

摘要

离线强化学习(ORL)因能够从任意预先生成的经验中学习,对机器人学习具有巨大前景。然而,当前的ORL基准几乎完全在仿真中,并利用诸如在线RL智能体的回放缓冲区或次优轨迹等人为构造的数据集,因此与现实世界机器人技术的关联性有限。在这项工作(Real-ORL)中,我们认为从密切相关任务的安全操作中收集的数据是现实世界机器人学习更实用的数据源。在这些设定下,我们进行了广泛的实证研究(收集了6500+条轨迹,超过800+机器人小时和270+人工小时),评估代表性ORL方法在四个现实世界桌面操纵任务上的泛化和迁移能力。我们的研究发现,ORL和模仿学习偏好不同的动作空间,并且ORL算法可以利用离线异构数据源进行泛化并优于模仿学习。我们在URL:https://sites.google.com/view/real-orl发布了我们的数据集和实现。

关键词

引用

@article{arxiv.2210.06479,
  title  = {Real World Offline Reinforcement Learning with Realistic Data Source},
  author = {Gaoyue Zhou and Liyiming Ke and Siddhartha Srinivasa and Abhinav Gupta and Aravind Rajeswaran and Vikash Kumar},
  journal= {arXiv preprint arXiv:2210.06479},
  year   = {2022}
}

备注

Project website: https://sites.google.com/view/real-orl