中文

基于混合策略梯度的高度自动驾驶车辆集成决策与控制及其实验验证

机器人学 2022-10-20 v1 人工智能

摘要

自我进化是实现完全自动驾驶不可或缺的环节。本文提出一种基于集成决策与控制(IDC)的自进化决策系统,IDC 是一种构建于强化学习(RL)之上的先进框架。首先,提出一种称为约束混合策略梯度(CMPG)的 RL 算法,以持续升级 IDC 的驾驶策略。它在惩罚方法下对 MPG 进行适配,从而能够利用数据与模型求解约束优化问题。其次,设计一种基于注意力的编码(ABE)方法来解决状态表示问题。它引入用于特征提取的嵌入网络与用于特征融合的加权网络,实现了对道路使用者的顺序不敏感编码与重要性区分。最后,通过融合 CMPG 与 ABE,我们开发了 IDC 架构下首个数据驱动的决策与控制系统,并将该系统部署于日常运行的全功能自动驾驶车辆上。实验结果表明,在数据助推下,该系统相比基于模型的方法可实现更优的驾驶能力。它还在具有真实混合交通流的信号化交叉口的多种复杂场景中展现出安全、高效与智能的驾驶行为。

关键词

引用

@article{arxiv.2210.10613,
  title  = {Integrated Decision and Control for High-Level Automated Vehicles by Mixed Policy Gradient and Its Experiment Verification},
  author = {Yang Guan and Liye Tang and Chuanxiao Li and Shengbo Eben Li and Yangang Ren and Junqing Wei and Bo Zhang and Keqiang Li},
  journal= {arXiv preprint arXiv:2210.10613},
  year   = {2022}
}