基于拓扑结构的多代理强化学习用于联合自动驾驶车辆的协同决策
人工智能
2025-07-17 v1
摘要
探索-开发权衡是强化学习(RL)中的一个根本性挑战,在多代理强化学习(MARL)中由于联合状态-动作空间的指数级增长,这一挑战被进一步加剧。本文提出了一种拓扑增强型多代理强化学习(TPE-MARL)方法,用于优化联通自动驾驶车辆(CAVs)在混合交通中的协同决策。本工作的两个主要贡献在于:首先,我们构建了一个用于动态交通流的游戏拓扑张量,有效压缩高维交通状态信息,并降低MARL算法的搜索空间;其次,在所设计的游戏拓扑张量基础上,并采用QMIX作为基础RL算法,我们建立了一个集成访问计数和代理间相互信息的拓扑增强型多代理强化学习框架。广泛的仿真实验在不同的交通密度和CAV渗透率下表明了TPE-MARL的有效性。涵盖训练动力学、探索模式、宏观交通性能指标以及微观车辆行为的评估结果表明,TPE-MARL成功地实现了探索与开发的平衡,因此在交通效率、安全性、决策平滑性和任务完成度方面表现出优异性能。此外,该算法在混合自主和完全自主交通场景中,均显示出与或超过人类驾驶员的决策合理性。我们的工作代码已公开于\href{https://github.com/leoPub/tpemarl}{https://github.com/leoPub/tpemarl}。
引用
@article{arxiv.2507.12110,
title = {Topology Enhanced MARL for Multi-Vehicle Cooperative Decision-Making of CAVs},
author = {Ye Han and Lijun Zhang and Dejian Meng and Zhuang Zhang},
journal= {arXiv preprint arXiv:2507.12110},
year = {2025}
}
备注
16 pages, 16 figures