OffLight:用于交通信号控制的离线多智能体强化学习框架
人工智能
2025-03-19 v3 机器学习
多智能体系统
摘要
高效的交通信号控制对于城市出行至关重要,但传统系统在处理真实交通的复杂性方面存在困难。多智能体强化学习提供了自适应解决方案,但在线MARL需要与环境进行大量交互,成本高昂且不切实际。离线MARL通过利用历史交通数据进行训练来缓解这些挑战,但面临真实世界数据集中异质行为策略带来的重大困难,其中混合质量的数据使学习复杂化。我们提出了OffLight,一个专为处理交通信号控制数据集中异质行为策略而设计的新型离线MARL框架。为提高学习效率,OffLight结合了重要性采样以纠正分布偏移,并采用基于回报的优先级采样以聚焦高质量经验。OffLight利用高斯混合变分图自编码器从局部观测中捕获行为策略的多样分布。在真实城市交通场景中的大量实验表明,OffLight优于现有的离线强化学习方法,实现了平均出行时间最多降低7.8%和排队长度减少11.2%。消融研究证实了OffLight各组件在处理异质数据和提升策略性能方面的有效性。这些结果凸显了OffLight的可扩展性及其在不承担在线学习风险的情况下改善城市交通管理的潜力。
引用
@article{arxiv.2411.06601,
title = {OffLight: An Offline Multi-Agent Reinforcement Learning Framework for Traffic Signal Control},
author = {Rohit Bokade and Xiaoning Jin},
journal= {arXiv preprint arXiv:2411.06601},
year = {2025}
}