中文

基于动作掩码强化学习的安全且心理愉悦的交通信号控制

机器学习 2022-06-22 v1

摘要

用于交通信号控制(TSC)的强化学习(RL)在仿真中展现出优于传统方法的交叉口交通流控制性能。然而,由于若干挑战,目前尚无基于 RL 的 TSC 在实际现场部署。实际部署的一大挑战是确保运行期间始终满足所有安全要求。我们提出一种通过按设计安全的动作空间来确保真实世界交叉口安全的方法。该动作空间涵盖交通相位,即交叉口非冲突信号颜色的组合。此外,动作掩码机制确保仅执行恰当的相位切换。实际部署的另一挑战是确保避免道路使用者压力的控制行为。我们展示了如何通过扩展动作掩码机制融入领域知识来实现这一点。我们在真实仿真场景中测试并验证了该方法。通过确保安全且心理愉悦的控制行为,我们的方法推动了 RL 用于 TSC 的实际部署进程。

关键词

引用

@article{arxiv.2206.10122,
  title  = {Safe and Psychologically Pleasant Traffic Signal Control with Reinforcement Learning using Action Masking},
  author = {Arthur Müller and Matthia Sabatelli},
  journal= {arXiv preprint arXiv:2206.10122},
  year   = {2022}
}

备注

Paper was accepted by the ITSC 2022 (25th IEEE International Conference on Intelligent Transportation Systems)