面向网联自动驾驶车辆的多智能体概率集成与轨迹采样
机器人学
2024-07-18 v3 机器学习
多智能体系统
摘要
自动驾驶车辆近年来引起了广泛关注,而强化学习在提升车辆自主性方面展现出了卓越的性能。在这方面,被广泛采用的无模型强化学习有望解决网联自动驾驶车辆中的决策任务,其前提是需具备大量用于训练的数据样本。然而,这在实践中可能并不可行,且可能导致学习不稳定。相比之下,基于模型的强化学习展现出样本高效的学习能力,但其渐近性能可能落后于最先进的无模型强化学习算法。此外,针对网联自动驾驶车辆的大多数研究仅局限于单车决策,从而因缺乏通信而限制了性能。在本研究中,我们尝试解决通信受限下多辆网联自动驾驶车辆的决策问题,并提出了一种去中心化的多智能体概率集成与轨迹采样算法 MA-PETS。具体而言,为了更好地捕捉未知环境的不确定性,MA-PETS 利用概率集成神经网络从相邻网联自动驾驶车辆通信的样本中进行学习。随后,MA-PETS 能够开发基于轨迹采样的模型预测控制以进行决策。在此基础上,我们推导了受通信范围内智能体数量影响的多智能体群体遗憾界,并在数学上验证了将智能体间的有效信息交换纳入多智能体学习方案有助于在最坏情况下降低群体遗憾界。最后,我们通过实验证明了 MA-PETS 在样本效率方面的优越性,其可与无模型强化学习相媲美。
引用
@article{arxiv.2312.13910,
title = {Multi-Agent Probabilistic Ensembles with Trajectory Sampling for Connected Autonomous Vehicles},
author = {Ruoqi Wen and Jiahao Huang and Rongpeng Li and Guoru Ding and Zhifeng Zhao},
journal= {arXiv preprint arXiv:2312.13910},
year = {2024}
}