中文

下一步去向何方:面向行人环境中导航的子目标推荐策略学习

机器人学 2021-03-01 v2 机器学习

摘要

在与其他机器人或人类共享的环境中进行机器人导航仍然具有挑战性,因为周围智能体的意图不可直接观测,且环境条件持续变化。局部轨迹优化方法,如模型预测控制(MPC),能够处理这些变化,但需要全局引导,而在拥挤场景中获取全局引导并非易事。本文提出通过深度强化学习(RL)学习一种交互感知策略,为局部规划器提供长期引导。特别地,在包含合作与非合作智能体的仿真中,我们训练了一个深度网络为MPC规划器推荐子目标。所推荐的子目标有望帮助机器人朝其目标推进,并考量与其他智能体的预期交互。基于推荐的子目标,MPC规划器随后优化机器人的输入,以满足其运动动力学与避碰约束。我们的方法相较于先前的MPC框架在碰撞次数方面,以及相较于深度RL方法在合作、竞争与混合多智能体场景中的行驶时间与碰撞次数方面,均显著提升了导航性能。

关键词

引用

@article{arxiv.2102.13073,
  title  = {Where to go next: Learning a Subgoal Recommendation Policy for Navigation Among Pedestrians},
  author = {Bruno Brito and Michael Everett and Jonathan P. How and Javier Alonso-Mora},
  journal= {arXiv preprint arXiv:2102.13073},
  year   = {2021}
}

备注

8 pages, 6 figures