闭环规划与学习的结合及其在自动驾驶中的应用
机器人学
2022-08-10 v3
摘要
不确定性下的实时规划对于在复杂动态环境中运行的机器人至关重要。以自主机器车辆在汽车、摩托车、公交车等密集且无管制的城市交通中行驶为例。机器车辆必须进行短期与长期规划,以便与许多意图不确定的交通参与者交互并有效行驶。然而,在长时间范围内显式规划会带来极高的计算成本,在实时约束下不切实际。为实现大规模规划的实时性能,本文提出一种新算法“从树搜索中学习驾驶”(LeTS-Drive),将规划与学习集成于闭环中,并将其应用于仿真中拥挤城市交通的自动驾驶。具体而言,LeTS-Drive 从在线规划器提供的数据中学习策略及其价值函数,该规划器搜索稀疏采样的信念树;在线规划器转而利用学习到的策略与价值函数作为启发式方法,以提升其实时机器人控制的运行性能。这两步反复执行形成闭环,使规划器与学习器相互告知并同步改进。该算法以自监督方式自行学习,无需人工进行显式数据标注。实验结果表明,LeTS-Drive 优于单独的规划或学习,以及规划与学习的开环集成。
引用
@article{arxiv.2101.03834,
title = {Closing the Planning-Learning Loop with Application to Autonomous Driving},
author = {Panpan Cai and David Hsu},
journal= {arXiv preprint arXiv:2101.03834},
year = {2022}
}
备注
Conditionally accepted by T-RO