中文

NavRep:用于动态人类环境中机器人导航强化学习的无监督表示

机器人学 2020-12-09 v1 机器学习

摘要

机器人导航是一项强化学习方法仍无法与传统路径规划竞争的的任务。最先进的方法在细微之处存在差异,且并非都提供可复现、公开可用的实现,这使得方法比较成为挑战。近期研究表明,无监督学习方法可令人印象深刻地扩展,并被用以解决困难问题。在本工作中,我们设计了利用无监督学习辅助机器人导航强化学习的方式。我们训练了两种端到端架构和 18 种基于无监督学习的架构,并在未见测试案例中与现有方法进行比较。我们展示了我们的方法在真实机器人上工作的效果。结果表明无监督学习方法可与端到端方法竞争。我们还强调了输入表示、预测性无监督学习和潜在特征等各组件的重要性。我们公开所有模型,以及训练和测试环境与工具。该发布还包括与 OpenAI-gym 兼容的环境,旨在尽可能忠实地复现其他论文所描述的训练条件。我们希望这有助于凝聚机器人导航 RL 领域,并实现跨最先进方法的有意义比较。

关键词

引用

@article{arxiv.2012.04406,
  title  = {NavRep: Unsupervised Representations for Reinforcement Learning of Robot Navigation in Dynamic Human Environments},
  author = {Daniel Dugas and Juan Nieto and Roland Siegwart and Jen Jen Chung},
  journal= {arXiv preprint arXiv:2012.04406},
  year   = {2020}
}

备注

Pre-print, submitted to ICRA 2021