中文

无限时域竞争马尔可夫博弈中去中心化乐观梯度下降/上升的末次迭代收敛

机器学习 2021-07-08 v2 人工智能 机器学习

摘要

我们研究无限时域折扣双人零和马尔可夫博弈,并开发了一种在自博弈下可证明收敛到纳什均衡集的去中心化算法。我们的算法基于在每个状态上运行乐观梯度下降上升(Optimistic Gradient Descent Ascent)算法来学习策略,并配有一个缓慢学习每个状态价值的评论家(critic)。据我们所知,这是该设定下首个同时具备理性(当对手使用平稳策略时收敛到其最优响应)、收敛性(自博弈下收敛到纳什均衡集)、不可知性(无需知道对手所采取的动作)、对称性(算法中玩家角色对称)以及享有有限时间末次迭代收敛保证的算法,这些均为去中心化算法的理想性质。

关键词

引用

@article{arxiv.2102.04540,
  title  = {Last-iterate Convergence of Decentralized Optimistic Gradient Descent/Ascent in Infinite-horizon Competitive Markov Games},
  author = {Chen-Yu Wei and Chung-Wei Lee and Mengxiao Zhang and Haipeng Luo},
  journal= {arXiv preprint arXiv:2102.04540},
  year   = {2021}
}