中文

基于演示引导与多任务强化学习的自主练习系统

机器人学 2022-03-30 v1

摘要

强化学习系统有潜力在非结构化环境中利用自主收集的数据实现持续改进。然而在实践中,这些系统需要大量的 instrumentation 或人工干预才能在真实世界中学习。在这项工作中,我们提出了一种强化学习系统,它利用以先验数据引导的多任务强化学习来实现持续的自主练习,在最小化所需重置次数的同时能够学习具有时间扩展的行为。我们展示了恰当提供的先验数据如何帮助引导低级多任务策略以及将这些任务依次排序的策略,从而实现最小重置下的学习。该机制使我们的机器人系统能够在训练时以最少人工干预进行练习,同时在测试时解决长视野任务。我们在具有挑战性的厨房操作任务上,于仿真和真实世界中展示了所提系统的有效性,证明了自主练习以解决时间扩展问题的能力。

关键词

引用

@article{arxiv.2203.15755,
  title  = {Demonstration-Bootstrapped Autonomous Practicing via Multi-Task Reinforcement Learning},
  author = {Abhishek Gupta and Corey Lynch and Brandon Kinman and Garrett Peake and Sergey Levine and Karol Hausman},
  journal= {arXiv preprint arXiv:2203.15755},
  year   = {2022}
}

备注

Interactive website at https://dbap-rl.github.io/