中文

网络化多智能体强化学习中局部策略迭代的全局收敛性

机器学习 2022-12-01 v1 人工智能 多智能体系统 最优化与控制

摘要

我们研究了一个多智能体强化学习(MARL)问题,其中智能体在给定网络上进行交互。智能体的目标是协作最大化其熵正则化长期奖励的平均值。为克服维数灾难并减少通信,我们提出了一种局部策略迭代(LPI)算法,该算法可证明仅利用局部信息即可学习到近全局最优策略。具体而言,我们表明,尽管将每个智能体的注意力限制在其 κ\kappa-跳邻域内,智能体仍能够学习到最优性差距随 κ\kappa 多项式衰减的策略。此外,我们给出了 LPI 有限样本收敛到全局最优策略的结果,其显式刻画了在选择 κ\kappa 时最优性与计算复杂度之间的权衡。数值仿真证明了 LPI 的有效性。

关键词

引用

@article{arxiv.2211.17116,
  title  = {Global Convergence of Localized Policy Iteration in Networked Multi-Agent Reinforcement Learning},
  author = {Yizhou Zhang and Guannan Qu and Pan Xu and Yiheng Lin and Zaiwei Chen and Adam Wierman},
  journal= {arXiv preprint arXiv:2211.17116},
  year   = {2022}
}