基于强化学习的自动驾驶车辆协商感知运动规划
机器人学
2021-07-09 v1 系统与控制
系统与控制
摘要
对于融入含有人类交通参与者的道路的自动驾驶车辆,需要通过以可预测的方式响应,在没有显式通信的情况下理解并适应参与者的意图与驾驶风格。本文提出一种基于强化学习(RL)的协商感知运动规划框架,其采用 RL 通过相对于环境变化事件(通常由具有不同驾驶风格的交通参与者意图切换触发)实时自适应地动态修改运动规划器的预测时域长度,来调整规划器的驾驶风格。该框架将自动驾驶车辆与其他交通参与者之间的交互建模为马尔可夫决策过程。占用栅格地图的时间序列被作为 RL 模块的输入以嵌入隐式意图推理。采用课程学习以提升训练效率与算法的鲁棒性。我们将该方法应用于仿真与真实世界的窄车道导航,以证明所提方法因其在以恰当协商技能缓解社会困境问题上的优势而优于常见替代方案。
引用
@article{arxiv.2107.03600,
title = {Reinforcement Learning based Negotiation-aware Motion Planning of Autonomous Vehicles},
author = {Zhitao Wang and Yuzheng Zhuang and Qiang Gu and Dong Chen and Hongbo Zhang and Wulong Liu},
journal= {arXiv preprint arXiv:2107.03600},
year = {2021}
}