中文

基于模型的图强化学习用于归纳式交通信号控制

机器学习 2022-08-02 v1 机器学习

摘要

大多数用于自适应交通信号控制的强化学习方法都需要从头训练,才能应用于任何新路口,或在道路网络、交通分布或训练时所受行为约束发生任何改动后使用。考虑到 1) 训练此类方法所需的大量经验,以及 2) 这些经验必须通过以探索式方式与真实道路网络使用者交互来收集,这种缺乏可迁移性的特点限制了实验与应用。近期的方法能够学习可泛化至未见道路网络拓扑与交通分布的策略,部分地应对了这一挑战。然而,文献中对于循环(路口连通性演化须遵循一循环)与非循环(约束较少)策略的学习仍存分歧,且这些可迁移方法 1) 仅兼容循环约束,2) 不支持协调。我们提出一种基于模型的新方法 MuJAM,它除首次实现大规模显式协调外,还通过将泛化推进到控制器约束层面而进一步提升了泛化能力。在一个涉及训练时从未见过的道路网络与交通设置的零样本迁移设定中,以及一个涉及曼哈顿 3,971 个交通信号控制器控制的大规模迁移实验中,我们表明 MuJAM 在使用循环与非循环两类约束时,均优于领域专用基线以及另一种可迁移方法。

关键词

引用

@article{arxiv.2208.00659,
  title  = {Model-based graph reinforcement learning for inductive traffic signal control},
  author = {François-Xavier Devailly and Denis Larocque and Laurent Charlin},
  journal= {arXiv preprint arXiv:2208.00659},
  year   = {2022}
}

备注

11 pages, 3 tables, 4 figures