中文

面向交通信号控制的强化学习诊断

机器学习 2019-05-14 v1 人工智能

摘要

随着交通数据可用性的提升以及深度强化学习技术的进步,利用强化学习(RL)进行交通信号控制正成为一种新兴趋势。将 RL 应用于交通信号控制的一个关键问题是如何定义奖励与状态。交通信号控制的最终目标是最小化行程时间,而这难以直接达到。因此,现有研究通常将奖励定义为若干交通度量的临时加权线性组合。然而,无法保证该奖励能优化行程时间。此外,近期的 RL 方法使用更复杂的状态(如图像)以描述完整的交通状况。但现有研究均未讨论此类复杂状态表示是否必要。这种额外的复杂性可能导致学习过程显著变慢,却未必带来显著的性能提升。本文提出透过经典交通理论重新审视 RL 方法。我们提出以下问题:(1)应如何设计奖励以 guaranteed 最小化行程时间?(2)如何设计简洁且足以获得最优解的状态表示?我们提出的方法 LIT 在交通领域经典交通信号控制方法上具有理论支撑。LIT 具有非常简单的状态与奖励设计,因此可作为未来交通信号控制 RL 方法的基本构件。在合成与真实数据集上的大量实验表明,我们的方法显著优于最先进的交通信号控制方法。

关键词

引用

@article{arxiv.1905.04716,
  title  = {Diagnosing Reinforcement Learning for Traffic Signal Control},
  author = {Guanjie Zheng and Xinshi Zang and Nan Xu and Hua Wei and Zhengyao Yu and Vikash Gayah and Kai Xu and Zhenhui Li},
  journal= {arXiv preprint arXiv:1905.04716},
  year   = {2019}
}