非信号交叉口网联自动驾驶车辆的协同控制:一种基于值分解的多智能体深度强化学习方法
机器人学
2022-11-17 v2
摘要
近年来多智能体深度强化学习(MDRL)研究的蓬勃发展,为协调多辆网联自动驾驶车辆(CAVs)通过交叉口提供了一种令人鼓舞的途径。本文应用一种基于值分解的 MDRL 方法(QMIX)来控制混合自主交通中不同密度下的多种 CAV,以公平合理的燃油消耗高效且安全地通过非信号交叉口。我们在纯 QMIX 框架中加入了网络层面的改进、基于 TD() 的 Q 值更新以及奖励裁剪操作等实现技巧,有望提升原版本的收敛速度与渐近性能。我们通过若干评价指标证明了方法的有效性:平均速度、碰撞次数以及每回合平均燃油消耗。实验结果表明,我们的方法在收敛速度与渐近性能上均优于原始 QMIX 以及近端策略优化(PPO)——一种应用于非信号交叉口的先进强化学习基线。此外,在低交通流下由我们的方法控制的 CAV 能够在无碰撞的情况下提升平均速度并消耗最少燃油。我们还在加倍交通密度下进行了训练,学习奖励得以收敛。因此,具有最大奖励与最小崩溃次数的模型仍能保证低燃油消耗,但相比低交通流情形略微降低了车辆效率并引发了更多碰撞,这意味着将 RL 策略泛化到更高级场景的难度。
引用
@article{arxiv.2211.07967,
title = {Coordination for Connected and Automated Vehicles at Non-signalized Intersections: A Value Decomposition-based Multiagent Deep Reinforcement Learning Approach},
author = {Zihan Guo and Yan Wu and Lifang Wang and Junzhi Zhang},
journal= {arXiv preprint arXiv:2211.07967},
year = {2022}
}