DiffLight:一种部分奖励条件扩散模型用于缺失数据下的交通信号控制
系统与控制
2024-11-01 v2 人工智能
机器学习
系统与控制
摘要
强化学习在交通信号控制(TSC)中的应用已得到广泛研究并取得了显著成果。然而,大多数现有的TSC工作假设所有相邻交叉口的交通数据通过传感器完整且连续地获取。在实际应用中,由于传感器故障或数据丢失,这一假设往往不成立,使得缺失数据下的交通信号控制成为一个关键挑战。为满足实际应用需求,我们提出了DiffLight,一种用于离线设置下缺失数据场景TSC的新型条件扩散模型。具体而言,我们通过利用部分奖励条件扩散(PRCD)模型整合两个关键子任务,即交通数据填补与决策制定,以防止缺失奖励对学习过程的干扰。同时,为有效捕捉交叉口之间的时空依赖性,我们设计了时空变换器(STFormer)架构。此外,我们提出了一种扩散通信机制(DCM),以在缺失数据场景下促进更好的通信与控制性能。在五个具有各种缺失数据场景的数据集上进行的广泛实验表明,DiffLight是一种有效应对缺失数据下TSC的控制器。DiffLight的代码已发布于https://github.com/lokol5579/DiffLight-release。
引用
@article{arxiv.2410.22938,
title = {DiffLight: A Partial Rewards Conditioned Diffusion Model for Traffic Signal Control with Missing Data},
author = {Hanyang Chen and Yang Jiang and Shengnan Guo and Xiaowei Mao and Youfang Lin and Huaiyu Wan},
journal= {arXiv preprint arXiv:2410.22938},
year = {2024}
}
备注
Accepted by NeurIPS 2024