中文

面向公平性的人类中心化交通信号控制:基于多智能体动作分支深度强化学习方法

机器学习 2026-02-04 v1 系统与控制 系统与控制

摘要

由于许多多智能体深度强化学习 (DRL) 方法仍以车辆为中心,且难以处理高维离散动作空间,因此在多模态走廊上协调交通信号是一个挑战。我们提出MA2B-DDQN,一种人类中心化多智能体动作分支双Deep Q-Network (DQN) 框架,显式优化旅客层面的公平性。我们的关键贡献是一种动作分支离散控制表述,将走廊控制分解为:(i) 分配给下一阶段绿灯时间的局部、每交叉口动作;以及(ii) 选择这些阶段总时长的单个全局动作。这一分解实现了在离散控制下的可扩展协调,同时降低了联合决策的有效复杂度。我们还设计了人类中心化奖励函数,对走廊内延迟乘客数进行惩罚,考虑到行人、车辆乘客以及公共交通乘客。广泛的评估在澳大利亚墨尔本的七个真实交通情景中表明,我们的方法显著减少了受影响旅客的数量,超越现有DRL和基线方法。实验确认了该模型的鲁棒性,显示在多样化设置下的方差最小。该框架不仅倡导更公平的交通信号系统,也提供了一个可适应不同城市交通状况的可扩展解决方案。

关键词

引用

@article{arxiv.2602.02959,
  title  = {Human-Centric Traffic Signal Control for Equity: A Multi-Agent Action Branching Deep Reinforcement Learning Approach},
  author = {Xiaocai Zhang and Neema Nassir and Lok Sang Chan and Milad Haghani},
  journal= {arXiv preprint arXiv:2602.02959},
  year   = {2026}
}