学习可解释的交通信号控制策略
机器学习
2020-02-28 v2 机器学习
摘要
信号交叉口由控制器管理,这些控制器将通行权(绿灯、黄灯和红灯)分配给无冲突的方向。优化此类控制器的驱动策略有望缓解交通拥堵及其不利影响。鉴于这一安全关键领域,相关的驱动策略需要以人类可理解和可规范的方式具有可解释性。本文提出并分析了几种用于调优可解释控制函数的在线优化技术。尽管这些技术以通用方式定义,本文为分析目的假定一类特定的可解释控制函数(多项式函数)。我们展示了此类可解释策略函数可媲美深度神经网络用于逼近优化后的信号驱动策略。我们给出了支持使用基于价值的强化学习对控制函数进行在线训练的实证证据。具体而言,我们提出并研究了三种允许训练可解释策略函数的 Deep Q-learning 算法变体。我们的 Deep Regulatable Hardmax Q-learning 变体被证明在优化可解释驱动策略方面特别有效,与常用部署的感应式信号控制器相比,车辆延误最多减少 19.4%。
引用
@article{arxiv.1912.11023,
title = {Learning an Interpretable Traffic Signal Control Policy},
author = {James Ault and Josiah P. Hanna and Guni Sharon},
journal= {arXiv preprint arXiv:1912.11023},
year = {2020}
}