利用异步多智能体强化学习缓解公交串车
机器学习
2021-09-02 v2 多智能体系统
摘要
公交系统是可持续城市交通的关键组成部分。然而,由于乘客需求和交通状况的显著不确定性,公交运营本质上不稳定,公交串车已成为一种常见现象,损害了公交服务的可靠性和效率。尽管多智能体强化学习(MARL)在交通控制方面取得了最新进展,但由于棘手的异步特性——控制动作仅在公交车到达公交站时发生,因而智能体并非同时行动——鲜有研究关注公交车队控制。在本研究中,我们将线路级公交车队控制建模为异步多智能体强化学习(ASMR)问题,并扩展经典的 actor-critic 架构以处理异步问题。具体而言,我们设计了一种新颖的评论家网络来有效近似其他智能体的边际贡献,其中使用图注意力神经网络进行策略评估的归纳学习。该评论家结构也帮助自我智能体更高效地优化其策略。我们在真实世界公交服务和来自智能卡数据的实际乘客需求上评估了所提框架。我们的结果表明,所提出的模型优于传统的基于车头时距的控制方法和现有的 MARL 方法。
引用
@article{arxiv.2105.00376,
title = {Reducing Bus Bunching with Asynchronous Multi-Agent Reinforcement Learning},
author = {Jiawei Wang and Lijun Sun},
journal= {arXiv preprint arXiv:2105.00376},
year = {2021}
}
备注
IJCAI-2021