用于基于图的多智能体强化学习的分解值函数
机器学习
2026-01-19 v1
摘要
信用分配是多智能体强化学习(MARL)中的核心挑战,尤其是在具有结构化局部交互的大规模系统中。基于图的马尔可夫决策过程(GMDPs)通过影响图捕捉了此类设定,但标准的评论者与这种结构并不匹配:全局值函数为每个智能体提供的学习信号微弱,而现有的局部构造在无限期设定中难以估计且行为异常。我们引入了扩散值函数(DVF),一种用于GMDPs的分解值函数,它通过带有时间折扣和空间衰减的奖励在影响图上的扩散,为每个智能体分配一个值分量。我们证明DVF是定义良好的,存在贝尔曼不动点,并通过平均性质分解全局折扣值。DVF可作为标准强化学习算法中的即插即用型评论者,并可通过图神经网络进行可扩展的估计。基于DVF,我们提出了扩散A2C(DA2C)和一个稀疏消息传递执行器——学习型DropEdge GNN(LD-GNN),用于在通信成本下学习去中心化算法。在消防基准测试和三个分布式计算任务(向量图着色和两个发射功率优化问题)中,DA2C始终优于局部和全局评论者基线,将平均奖励提高了最多11%。
引用
@article{arxiv.2601.11401,
title = {Factored Value Functions for Graph-Based Multi-Agent Reinforcement Learning},
author = {Ahmed Rashwan and Keith Briggs and Chris Budd and Lisa Kreusser},
journal= {arXiv preprint arXiv:2601.11401},
year = {2026}
}