中文

利用域随机化与元学习弥合基于强化学习的交通信号控制中的现实差距

机器学习 2023-07-24 v1

摘要

强化学习(RL)已在交通信号控制(TSC)应用中被广泛探索,然而至今仍无此类系统在实际中部署。该领域进展的一个关键障碍是现实差距,即仿真模型与其真实对应物之间差异所导致的偏差。在本文中,我们通过首先全面分析导致该现实差距的潜在仿真参数来应对这一挑战。我们还考察了两种有前景的弥合该差距的策略:域随机化(DR)和模型无关元学习(MAML)。两种策略均使用某个交叉口的交通仿真模型进行训练。此外,该模型被嵌入 LemgoRL 中,这是一个将现实、安全关键需求集成到控制系统中的框架。随后,我们在使用不同交通仿真器开发的同一交叉口的独立模型上评估了这两种方法的性能。以此方式,我们模拟了现实差距。我们的实验结果表明,DR 和 MAML 均优于最先进的 RL 算法,从而凸显了它们在缓解基于 RL 的 TSC 系统中现实差距的潜力。

关键词

引用

@article{arxiv.2307.11357,
  title  = {Bridging the Reality Gap of Reinforcement Learning based Traffic Signal Control using Domain Randomization and Meta Learning},
  author = {Arthur Müller and Matthia Sabatelli},
  journal= {arXiv preprint arXiv:2307.11357},
  year   = {2023}
}

备注

Paper was accepted by the ITSC 2023 (26th IEEE International Conference on Intelligent Transportation Systems)