中文

HALO:大规模自适应交通信号控制的层次化强化学习

机器学习 2026-03-23 v3 人工智能

摘要

自适应交通信号控制(ATSC)对于缓解现代智慧城市中的城市拥堵至关重要,其中交通基础设施正演变为拥有数千个感知与控制节点的Web-of-Things(WoT)环境。然而,现有方法面临着规模与协调之间的关键权衡:集中方法可优化全局目标,但在城市规模下变得难以计算;而去中心化的多智能体方法则高效扩展,却缺乏网络层面的连贯性,导致次优性能。本文提出HALO(Hierarchical Architecture for Large-scale traffic control),一种解决大规模ATSC中此权衡的层次化强化学习框架。HALO将决策解耦为两个层次:高层全局指导策略采用Transformer-LSTM编码器建模整个网络的时空依赖性,并广播紧凑的指导信号;而低层局部交叉口策略则基于局部观察与全局上下文执行去中心化控制。为确保全局与局部目标更好地对齐,我们引入一种对抗性目标设定机制,其中全局策略提出具有挑战性但可实现的网络级目标,局部策略则训练以超越这些目标,从而促进稳健的协调。我们在多个标准基准以及一个新建的大规模类似曼哈顿的网络(包含2,668个交叉口)下进行了广泛评估,网络环境包括峰时转换、恶劣天气和假日高峰。结果表明,HALO在小规模基准中表现出竞争力且随网络复杂度增长而变得更加突出,在大规模场景中则实现最佳性能,平均行驶时间降低最高可达6.8%,平均延迟降低最高可达5.0%。

关键词

引用

@article{arxiv.2506.14391,
  title  = {HALO: Hierarchical Reinforcement Learning for Large-Scale Adaptive Traffic Signal Control},
  author = {Yaqiao Zhu and Hongkai Wen and Geyong Min and Man Luo},
  journal= {arXiv preprint arXiv:2506.14391},
  year   = {2026}
}

备注

Accepted to The Web Conference (WWW) 2026