中文

面向交通信号控制的多主体强化学习中的依赖动态

人工智能 2025-02-25 v1 多智能体系统

摘要

强化学习 (RL) 作为一种数据驱动的方法,正在成为复杂城市交通网络中自适应交通信号控制 (ATSC) 的热门选择,深度神经网络显著提升了其学习能力。然而,由于联合动作空间的维度极高,集中式 RL 在涉及多个智能体的 ATSC 场景中变得不可行。多主体强化学习 (MARL) 通过将控制分散到局部智能体来缓解了这种可扩展性问题。然而,这种分散方法引入了新的挑战:由于智能体之间的通信受限,每个局部智能体的视角下,环境变得部分可观测。在重载交叉口的条件下,集中式 RL 和 MARL 各有优势和劣势。本文证明,当智能体 (交叉口) 之间不存在溢出拥堵 (无智能体依赖) 时,MARL 可通过分解为多个独立强化学习 (IRL) 过程实现全局 Q 值的最优;当存在溢出拥堵 (存在智能体依赖) 时,可通过集中式 RL 实现最大全局 Q 值。基于上述结论,我们提出了一种用于深度 Q 网络 (DQN) 的动态参数更新策略 (DQN-DPUS),根据智能体之间的依赖动态更新权重和偏置,即在无溢出拥堵场景下仅更新对角子矩阵。我们在包含两个交叉口的简单网络中进行验证,结果表明该策略能在不牺牲最优探索效果的前提下加快收敛速度。实验结果证实了我们的理论结论,展示了 DQN-DPUS 在优化交通信号控制方面的有效性。

关键词

引用

@article{arxiv.2502.16608,
  title  = {Toward Dependency Dynamics in Multi-Agent Reinforcement Learning for Traffic Signal Control},
  author = {Yuli Zhang and Shangbo Wang and Dongyao Jia and Pengfei Fan and Ruiyuan Jiang and Hankang Gu and Andy H. F. Chow},
  journal= {arXiv preprint arXiv:2502.16608},
  year   = {2025}
}