面向网络化系统的平均奖励可扩展多智能体强化学习
最优化与控制
2020-06-12 v1 人工智能
机器学习
多智能体系统
系统与控制
系统与控制
摘要
人们早已认识到,多智能体强化学习(MARL)面临显著的可扩展性问题,因为状态和动作空间的大小随智能体数量呈指数级增长。在本文中,我们确定了一类丰富的网络化 MARL 问题,其中模型展现出局部依赖结构,使其能够以可扩展的方式求解。具体而言,我们提出了一种可扩展 actor-critic(SAC)方法,能够学习用于优化平均奖励的近最优局部策略,其复杂度随局部邻域的状态-动作空间大小而非整个网络扩展。我们的结果核心在于识别并利用一种指数衰减特性,该特性确保智能体之间的相互影响随其图距离呈指数级快速衰减。
引用
@article{arxiv.2006.06626,
title = {Scalable Multi-Agent Reinforcement Learning for Networked Systems with Average Reward},
author = {Guannan Qu and Yiheng Lin and Adam Wierman and Na Li},
journal= {arXiv preprint arXiv:2006.06626},
year = {2020}
}