中文

基于动量的低排放交通信号控制奖励设计

机器学习 2026-05-29 v1 机器人学

摘要

城市交通拥堵是全球性问题,对造成漫长的通勤时间和环境污染有显著贡献。传统的交通信号控制系统往往难以适应动态交通条件。自适应交通信号控制可以在不改变道路基础设施的前提下改善城市交通。深度强化学习(Deep Reinforcement Learning, DRL)已显示出强大的性能用于此任务,但现有的基于延迟和排队的奖励函数常常产生短视或不稳定的策略。本文提出了基于动量的奖励函数(Momentum-Based Reward Function, MBRF),鼓励车辆持续行驶,而不仅仅是惩罚拥堵。该方法在 SUMO(Simulation of Urban MObility)中进行评估,使用标准交通指标包括等待时间、排队长度、吞吐量和二氧化碳排放。结果表明,所提出的奖励函数在吞吐量-排放权衡和学习行为稳定性方面均优于基于延迟或排队的奖励,以及经典控制器如 Max Pressure 和 LQF。

关键词

引用

@article{arxiv.2605.29693,
  title  = {Momentum Based Reward Design for Low Emission Traffic Signal Control},
  author = {Chinmay Mundane and Amith Manoharan and Arun Singh},
  journal= {arXiv preprint arXiv:2605.29693},
  year   = {2026}
}