中文

面向多智能体网络系统的可扩展强化学习

最优化与控制 2021-11-02 v3 人工智能 机器学习

摘要

我们研究一种多智能体网络环境下的强化学习(RL),其中智能体的状态与动作以局部方式交互,目标是找到局部化策略以最大化(折扣)全局奖励。该设置下的一个基本挑战是状态-动作空间大小随智能体数量指数增长,使大规模网络问题难以处理。本文中,我们提出一种可扩展行动者-评论家(SAC)框架,该框架利用网络结构并找到局部化策略,对某个 ρ(0,1)\rho\in(0,1) 为目标函数平稳点的 O(ρκ)O(\rho^{\kappa})-近似,其复杂度随网络最大 κ\kappa-跳邻域的局部状态-动作空间大小缩放。我们使用来自无线通信、传染病与交通的示例来说明我们的模型与方法。

关键词

引用

@article{arxiv.1912.02906,
  title  = {Scalable Reinforcement Learning for Multi-Agent Networked Systems},
  author = {Guannan Qu and Adam Wierman and Na Li},
  journal= {arXiv preprint arXiv:1912.02906},
  year   = {2021}
}

备注

Accepted to Operations Research. Conference version appeared in 2nd Learning for Dynamics and Control Conference with title "Scalable Reinforcement Learning of Localized Policies for Multi-Agent Networked Systems". This journal version includes more examples, discussions and simulations