中文

面向道路交通控制的离线强化学习

人工智能 2022-12-13 v3 机器学习

摘要

交通信号控制是城市交通中的重要问题,具有显著的经济与环境影响潜力。尽管利用强化学习 (RL) 进行交通信号控制的研究兴趣日益增长,迄今工作多聚焦于通过仿真学习,而简化假设可能导致不准确。相反,真实的交通经验数据可得且能以极小成本利用。离线或批量 RL 的近期进展使之成为可能。尤其是基于模型的离线 RL 方法,已证明比其他方法更能从经验数据中泛化。我们构建了一个基于模型的学习框架,从采用循环交通信号控制策略(既普遍又易于收集)所采集的数据集推断马尔可夫决策过程 (MDP)。该 MDP 以悲观代价构建,通过自适应奖励塑形管理分布外场景,相较于先前相关工作不仅提供更优正则化,且为 PAC-最优。我们的模型在复杂信号化环岛上的评估表明,以数据高效方式构建高性能交通控制策略是可行的。

关键词

引用

@article{arxiv.2201.02381,
  title  = {Offline Reinforcement Learning for Road Traffic Control},
  author = {Mayuresh Kunjir and Sanjay Chawla},
  journal= {arXiv preprint arXiv:2201.02381},
  year   = {2022}
}

备注

30 pages