面向交通信号控制的贝叶斯元强化学习
机器学习
2021-10-26 v2 机器学习
摘要
近年来,用于交通信号控制的元强化学习方法受到越来越多的关注,其相比传统控制方法取得了更优性能。然而,以往方法在复杂情形下缺乏适应鲁棒性与训练过程稳定性,极大限制了其在真实世界交通信号控制中的应用。本文提出一种新颖的基于值的贝叶斯元强化学习框架BM-DQN,通过利用从已有场景中学得的训练良好先验知识,在新场景中鲁棒地加速学习过程。该框架基于我们提出的Gradient-EM贝叶斯元学习的快速适应变体以及DQN的快速更新优势,从而具备持续学习能力与对不确定性的鲁棒性,可快速适应新场景。在受限2D导航与交通信号控制上的实验表明,我们所提框架比以往方法在新场景中适应更快更鲁棒,尤其在异构场景中持续学习能力大幅更优。
引用
@article{arxiv.2010.00163,
title = {Bayesian Meta-reinforcement Learning for Traffic Signal Control},
author = {Yayi Zou and Zhiwei Qin},
journal= {arXiv preprint arXiv:2010.00163},
year = {2021}
}