MetaVIM:面向去中心化交通信号控制的元变分内在动机强化学习
机器学习
2024-04-02 v5 人工智能
多智能体系统
摘要
交通信号控制旨在协调交叉口间的交通信号,以提升区域或城市的交通效率。深度强化学习(RL)近期已被应用于交通信号控制,并展现出良好前景,其中每个交通信号被视为一个智能体。然而,仍有若干挑战可能限制其在现实世界中的大规模应用。为使从训练场景学到的策略能泛化至新的未见场景,本文提出一种新颖的元变分内在动机(MetaVIM)RL 方法,以潜在方式考虑邻居信息,学习每个交叉口的去中心化策略。具体而言,我们将策略学习表述为一组相关任务上的元学习问题,其中每个任务对应于一个交叉口的交通信号控制,其邻居被视为状态的未观测部分。随后,引入一个学到的潜变量表示任务特定信息,并进一步纳入策略用于学习。此外,为使策略学习稳定,设计了一种新颖的内在奖励,鼓励每个智能体仅基于自身历史对其接收的奖励与观测转移具有可预测性。在 CityFlow 上开展的广泛实验表明,所提方法大幅优于现有方法并展现出优越的泛化能力。
引用
@article{arxiv.2101.00746,
title = {MetaVIM: Meta Variationally Intrinsic Motivated Reinforcement Learning for Decentralized Traffic Signal Control},
author = {Liwen Zhu and Peixi Peng and Zongqing Lu and Xiangqian Wang and Yonghong Tian},
journal= {arXiv preprint arXiv:2101.00746},
year = {2024}
}