混合动作空间下用于交通信号控制的强化学习
系统与控制
2022-11-28 v2 人工智能
机器学习
系统与控制
摘要
主流的基于强化学习的交通信号控制方法通常依动作空间不同而可分为配时阶段可优化或绿信比时长可优化。本文提出一种基于混合近端策略优化的新型控制架构TBO。据我们所知,TBO是首个实现配时阶段与时长同步优化的基于RL的算法。相较于离散与连续动作空间,混合动作空间是一种合并的搜索空间,TBO在其中更好地实现了频繁切换与不饱和放行之间的权衡。实验表明,与现有基线相比,TBO平均分别降低排队长度与延误13.78%和14.08%。此外,我们计算了路权基尼系数以表明TBO在提升效率的同时不损害公平性。
引用
@article{arxiv.2211.12956,
title = {Reinforcement learning for traffic signal control in hybrid action space},
author = {Haoqing Luo and sheng jin},
journal= {arXiv preprint arXiv:2211.12956},
year = {2022}
}
备注
There are serious problems with the innovation of the paper