中文

一种用于RGBD室内机器人导航强化学习的A*课程方法

机器人学 2021-01-07 v1 机器学习

摘要

训练机器人在多样环境中导航是一项挑战性问题,因其涉及映射与定位等若干感知任务的汇合,继而是最优路径规划与控制。近期发布的如Habitat等照片级真实模拟器允许训练直接从感知输出控制动作的网络:智能体使用深度强化学习(DRL)以端到端方式从相机图像直接回归至控制输出。此法数据效率低,在GPU上训练需耗费数日。本文试图通过分离感知与控制神经网络的训练,并采用课程方法逐步增加路径复杂度来克服该问题。具体而言,使用预训练的双变分自编码器(VAE)将环境的RGBD(RGB与深度)感知压缩为潜在嵌入,再用于训练基于DRL的控制策略。传统路径规划器A*用作策略引导,且随着训练推进,沿A*路线逐步增大起始与目标位置间距离。我们在Habitat仿真环境的PointNav任务中证明了所提方法在性能提升与训练时间缩短两方面的有效性。这种改进基于直接感知的DRL导航策略训练的策略,有望加速工业界特别关注机器人(如工厂车间协作机器人与末端配送机器人)的部署。

关键词

引用

@article{arxiv.2101.01774,
  title  = {An A* Curriculum Approach to Reinforcement Learning for RGBD Indoor Robot Navigation},
  author = {Kaushik Balakrishnan and Punarjay Chakravarty and Shubham Shrivastava},
  journal= {arXiv preprint arXiv:2101.01774},
  year   = {2021}
}

备注

8 pages, 6 figures, 2 tables