中文

基于广义计算图的机器人导航自监督深度强化学习

机器学习 2018-05-21 v3 人工智能 机器人学

摘要

使机器人能够自主导航复杂环境对于其在现实世界中的部署至关重要。先前的方法通过让机器人维护一个内部世界地图,然后使用定位和规划方法在内部地图中进行导航来解决这个问题。然而,这些方法通常包含各种假设,计算量大,且无法从失败中学习。相比之下,基于学习的方法随着机器人在环境中行动而不断改进,但由于其高样本复杂度,难以在现实世界中部署。为了满足用少量样本学习复杂策略的需求,我们提出了一种广义计算图,它涵盖了基于值的无模型方法和基于模型的方法,其具体实例在无模型和有模型之间进行插值。然后我们实例化该图以形成一个从原始图像中学习且样本高效的导航模型。我们的模拟汽车实验探索了该导航模型的设计决策,并表明我们的方法优于单步和 NN 步双重 Q-learning。我们还在现实世界的遥控汽车上评估了我们的方法,并表明它可以通过几个小时的全自主、自监督训练学会在复杂的室内环境中导航。实验视频和代码可在 github.com/gkahn13/gcg 找到。

关键词

引用

@article{arxiv.1709.10489,
  title  = {Self-supervised Deep Reinforcement Learning with Generalized Computation Graphs for Robot Navigation},
  author = {Gregory Kahn and Adam Villaflor and Bosen Ding and Pieter Abbeel and Sergey Levine},
  journal= {arXiv preprint arXiv:1709.10489},
  year   = {2018}
}

备注

ICRA 2018