使用单一演员输出针对不同交叉口个性化策略
机器学习
2025-03-12 v1 人工智能
多智能体系统
摘要
近期,随着多智能体强化学习(MARL)的发展,自适应交通信号控制(ATSC)取得了令人满意的成果。在包含多个交叉口的交通场景中,MARL 将每个交叉口视为一个智能体,通过学习和实时决策来优化交通信号控制策略。考虑到在现实场景中,交叉口的观测分布可能不同,共享参数方法可能缺乏多样性,从而导致共享策略网络对高泛化性要求。典型解决方案是增加网络参数的规模。然而,我们的实验表明,仅增加网络规模并不一定提高策略的泛化性。因此,需要一种兼顾交叉口个性化与参数共享效率的方法。为此,我们提出了一种集中训练、去中心化执行(CTDE)MARL 方法——Hyper-Action Multi-Head Proximal Policy Optimization(HAMH-PPO),其利用共享 PPO 策略网络为具有非独立同分布观测分布的交叉口提供个性化策略。HAMH-PPO 中的集中 Critic 使用图注意力单元计算所有交叉口的图表示,并为每个交叉口输出多个输出头的值估计。去中心化执行的演员以局部观测历史为输入,输出动作分布以及一种称为超动作的量,以平衡来自集中 Critic 估计的多个值,从而进一步指导 TSC 策略的更新。超动作与多头值的组合使多个智能体能够共享单个演员-批评家,同时实现个性化策略。
引用
@article{arxiv.2503.07678,
title = {Using a single actor to output personalized policy for different intersections},
author = {Kailing Zhou and Chengwei Zhang and Furui Zhan and Wanting Liu and Yihong Li},
journal= {arXiv preprint arXiv:2503.07678},
year = {2025}
}