基于强化学习的交通信号控制在事故情境下的鲁棒性:比较研究
机器学习
2025-06-18 v1 人工智能
摘要
基于强化学习的交通信号控制 (RL-TSC) 已成为提高城市交通流的有前景的方法。然而,其在现实世界扰动(如交通事故)下的鲁棒性仍大体未被探讨。在本研究中,我们引入 T-REX,这是一个开源的、基于 SUMO 的仿真框架,用于在动态、事故情境下训练和评估 RL-TSC 方法。T-REX 模型考虑到司机概率性rerouting、速度适应和情境性车道变更,能够在事故情境下模拟拥堵的传播。为评估鲁棒性,我们提出了一套在常规交通效率度量之外的度量指标。通过在合成网络和真实网络上的大量实验,我们展示了 T-REX 用于评估多种最新 RL-TSC 方法在多个真实世界部署情境下的表现。我们的发现表明,虽然独立价值型和去中心化压力型方法在稳定交通情境和均质网络中具有快速收敛和泛化优势,但在事故驱动的分布迁移情境下性能会急剧下降。相比之下,层次化协同方法在大规模、非规则网络中倾向于提供更稳定和可适应的性能,得益于其结构化的决策架构。然而,这以更慢的收敛速度和更高的训练复杂度为代价。这些发现凸显了 RL-TSC 研究中需要鲁棒性意识的设计和评估。T-REX 通过提供一个开源、标准化和可复现的平台,用于在动态和破坏性交通情境下对比评估 RL 方法,为这一努力作出了贡献。
引用
@article{arxiv.2506.13836,
title = {Robustness of Reinforcement Learning-Based Traffic Signal Control under Incidents: A Comparative Study},
author = {Dang Viet Anh Nguyen and Carlos Lima Azevedo and Tomer Toledo and Filipe Rodrigues},
journal= {arXiv preprint arXiv:2506.13836},
year = {2025}
}
备注
35 pages, 5 figures, 3 tables