零和多项式矩阵马尔可夫博弈中策略优化的近最优末次迭代收敛
计算机科学与博弈论
2023-08-17 v2
摘要
在多玩家一般和马尔可夫博弈中计算近似纳什均衡是一项计算上难解的任务。然而,具有特定合作或竞争结构的多玩家马尔可夫博弈可能规避这种难解性。在本文中,我们关注多玩家零和多项式矩阵马尔可夫博弈,其中玩家以成对方式交互但整体保持竞争。据我们所知,我们提出了首个称为熵正则化乐观乘法权重更新(ER-OMWU)的策略优化算法,用于在具有完全信息反馈的有限时域零和多项式矩阵马尔可夫博弈中寻找近似纳什均衡。我们提供了末次迭代收敛保证,在 次迭代内找到 -近似纳什均衡,这与两人零和马尔可夫博弈中最优的 迭代复杂度相比是近最优的,而后者是仅涉及两名玩家的零和多项式矩阵博弈的退化情形。我们的算法将正则化与乐观学习动态结合,在单循环内实现分离的光滑值更新,玩家以对称且几乎解耦的方式更新策略。它提供了一种寻找均衡的自然动态,并且更有可能在未来仅存在部分信息反馈时被适配为样本高效且完全去中心化的实现。
引用
@article{arxiv.2308.07873,
title = {Near-Optimal Last-iterate Convergence of Policy Optimization in Zero-sum Polymatrix Markov games},
author = {Zailin Ma and Jiansheng Yang and Zhihua Zhang},
journal= {arXiv preprint arXiv:2308.07873},
year = {2023}
}
备注
Proof of Lemma 3.4 is wrong, \bar{L}_{h+1}^{t-k} should be replaced by \sqrt{\bar{L}_{h+1}^{t-k}}. In this case the proof of the main theorem should be substantially modified