中文

基于随机引导的导航学习

机器人学 2018-11-28 v1

摘要

由于稀疏奖励和高度的环境变化,诸如深度确定性策略梯度(DDPG)等强化学习方法在复杂真实世界环境中应用时深受高方差问题的困扰。我们提出一种通过引入随机切换来克服这些问题的新框架,使智能体可在高方差与低方差策略间选择。该随机切换可与原始 DDPG 在同一框架中联合训练。在本文中,我们在导航任务中展示了该框架的能力,其中机器人可动态选择通过探索学习,或利用启发式控制器的输出作为引导。导航能力无需从完全随机动作起步,而可由若干简单独立控制器快速引导建立。实验结果表明,借助随机引导,我们能够有效且高效地训练 DDPG 导航策略,并取得显著优于最先进基线模型的性能。

关键词

引用

@article{arxiv.1811.10756,
  title  = {Learning with Stochastic Guidance for Navigation},
  author = {Linhai Xie and Yishu Miao and Sen Wang and Phil Blunsom and Zhihua Wang and Changhao Chen and Andrew Markham and Niki Trigoni},
  journal= {arXiv preprint arXiv:1811.10756},
  year   = {2018}
}

备注

A short version is accepted by the NIPS 2018 workshop: Infer2Control