中文

马尔可夫博弈的策略优化:统一框架与更快收敛

机器学习 2022-07-26 v4 计算机科学与博弈论 多智能体系统 最优化与控制

摘要

本文研究多智能体强化学习的策略优化算法。我们首先针对完全信息设定下的双人零和马尔可夫博弈提出一个算法框架,其中每次迭代包含在每个状态使用某矩阵博弈算法进行的策略更新步骤,以及具有某学习率的值更新步骤。该框架统一了许多已有及新的策略优化算法。我们证明,只要矩阵博弈算法在每个状态取得相对于由值更新速度决定的权重的低加权遗憾,该算法的状态wise平均策略就收敛到博弈的近似纳什均衡(NE)。接下来,我们证明该框架在每个状态实例化以乐观跟随正则化领导者(OFTRL)算法(及平滑值更新)时,可在 TT 次迭代内找到 O~(T5/6)\mathcal{\widetilde{O}}(T^{-5/6}) 近似 NE,而具有稍作修改值更新规则的类似算法实现了更快的 O~(T1)\mathcal{\widetilde{O}}(T^{-1}) 收敛速率。这些改进优于当前对称策略优化类算法的最佳 O~(T1/2)\mathcal{\widetilde{O}}(T^{-1/2}) 速率。我们还将该算法扩展到多人一般和马尔可夫博弈,并展示出到粗相关均衡(CCE)的 O~(T3/4)\mathcal{\widetilde{O}}(T^{-3/4}) 收敛速率。最后,我们提供数值例子以验证理论并研究平滑值更新的重要性,发现改用“急切”值更新(等价于独立自然策略梯度算法)可能显著减慢收敛,即使在 H=2H=2 层的简单博弈上亦然。

关键词

引用

@article{arxiv.2206.02640,
  title  = {Policy Optimization for Markov Games: Unified Framework and Faster Convergence},
  author = {Runyu Zhang and Qinghua Liu and Huan Wang and Caiming Xiong and Na Li and Yu Bai},
  journal= {arXiv preprint arXiv:2206.02640},
  year   = {2022}
}