SocialLight:面向路网范围交通信号控制的分布式协作学习
机器学习
2023-05-26 v1
摘要
许多近期工作转向多智能体强化学习(MARL)用于自适应交通信号控制,以优化大型城市路网中车辆的行程时间。然而,在路口(智能体)间实现有效且可扩展的协作仍是一个开放挑战,因为现有方法常依赖广泛的、不可泛化的奖励塑形或不可扩展的集中式学习。为解决这些问题,我们提出一种用于交通信号控制的新MARL方法SocialLight,它通过分布式估计智能体在其局部邻域上的个体边际贡献来学习协作交通控制策略。SocialLight依赖异步行动者-评论者(A3C)框架,并通过学习以邻域智能体状态和动作为条件的局部集中式评论者来实现可扩展学习,智能体借此通过反事实推理估计个体贡献。我们进一步对优势计算引入重要修改以稳定策略更新。这些修改解耦了邻域动作对计算优势的影响,从而降低梯度更新的方差。我们在两个交通模拟器SUMO和CityFlow的标准基准上将训练好的网络与最先进交通信号控制方法对比。结果表明SocialLight对更大路网具有改进的可扩展性,并在常用交通指标上表现更优。
引用
@article{arxiv.2305.16145,
title = {SocialLight: Distributed Cooperation Learning towards Network-Wide Traffic Signal Control},
author = {Harsh Goel and Yifeng Zhang and Mehul Damani and Guillaume Sartoretti},
journal= {arXiv preprint arXiv:2305.16145},
year = {2023}
}
备注
To appear in the International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2023)