中文

L2B:在交互式人群感知机器人导航中学习平衡安全与效率的权衡

机器人学 2020-10-09 v2 机器学习

摘要

本工作提出了一种用于拥挤场所中交互式导航的深度强化学习框架。我们提出的方法——学习平衡 (Learning to Balance, L2B) 框架使移动机器人智能体能够安全驶向目的地,避免与人群发生碰撞,同时在必要时通过请求附近行人让路来主动清理路径,以保持行进效率。我们观察到,在人群感知导航中,安全与效率需求在智能体与人群之间的社会困境下存在权衡。一方面,为实现即时效率而过度干预行人路径将导致自然人群流的崩溃,并可能最终使包括自身在内的所有人面临碰撞风险。另一方面,保持沉默以避开每一次碰撞将导致智能体行进低效。基于该观察,我们的 L2B 框架扩充了用于学习交互式导航策略的奖励函数,以惩罚频繁的主动清路和被动避碰,从而显著改善了安全—效率权衡的平衡。我们在具有挑战性的人群仿真中评估了 L2B 框架,并在导航成功率和碰撞率方面证明了其相对于最先进导航方法的优越性。

关键词

引用

@article{arxiv.2003.09207,
  title  = {L2B: Learning to Balance the Safety-Efficiency Trade-off in Interactive Crowd-aware Robot Navigation},
  author = {Mai Nishimura and Ryo Yonetani},
  journal= {arXiv preprint arXiv:2003.09207},
  year   = {2020}
}

备注

Accepted at IROS2020. Project site: https://denkiwakame.github.io/l2b/