中文

自然行动者-评论者算法在分层线性二次调节器上的全局收敛性

机器学习 2021-12-28 v2 最优化与控制 机器学习

摘要

多智能体强化学习已成功应用于若干具有挑战性的问题。尽管有这些经验性成功,对不同算法的理论理解仍然缺乏,主要由于智能体数量增加导致状态-动作空间指数级增长所带来的维数灾难。我们研究在智能体部分可交换设定下的多智能体线性二次调节器(LQR)基本问题。在此设定下,我们开发了一种分层行动者-评论者算法,其计算复杂度与智能体总数无关,并证明其到最优策略的全局线性收敛性。由于 LQR 常用于近似一般动态系统,本文为更好理解一般分层平均场多智能体强化学习提供了重要一步。

关键词

引用

@article{arxiv.1912.06875,
  title  = {Natural Actor-Critic Converges Globally for Hierarchical Linear Quadratic Regulator},
  author = {Yuwei Luo and Zhuoran Yang and Zhaoran Wang and Mladen Kolar},
  journal= {arXiv preprint arXiv:1912.06875},
  year   = {2021}
}