双人零和马尔可夫博弈中乐观跟随正则化领导者算法的 $O(T^{-1})$ 收敛性
机器学习
2023-02-10 v2 计算机科学与博弈论
摘要
我们证明了乐观跟随正则化领导者算法(optimistic-follow-the-regularized-leader, OFTRL)结合平滑价值更新,在具有完全信息的双人零和马尔可夫博弈中,经过 次迭代可找到 近似纳什均衡。这改进了 Zhang 等人(2022)近期论文中给出的 收敛速率。这一精炼的分析依赖于两个关键要素。首先,两名玩家的后悔值之和虽然在马尔可夫博弈中不一定像正规形式博弈中那样非负,但在马尔可夫博弈中近似非负。该性质使我们能够界定学习动力学的二阶路径长度。其次,我们证明了一个关于 OFTRL 所部署权重的更紧的代数不等式,从而削去了一个额外的 因子。这一关键改进使得归纳分析得以实现,并导出了最终的 速率。
引用
@article{arxiv.2209.12430,
title = {$O(T^{-1})$ Convergence of Optimistic-Follow-the-Regularized-Leader in Two-Player Zero-Sum Markov Games},
author = {Yuepeng Yang and Cong Ma},
journal= {arXiv preprint arXiv:2209.12430},
year = {2023}
}
备注
Accepted to ICLR 2023