我们能否以线性速率在马尔可夫博弈中找到纳什均衡?
计算机科学与博弈论
2023-03-07 v1 机器学习
最优化与控制
摘要
我们研究双人零和折扣马尔可夫博弈中的去中心化学习,其目标是为任一智能体设计满足两个性质的策略优化算法。首先,该玩家无需知晓对手策略即可更新自身策略。其次,当双方均采用该算法时,其联合策略收敛至博弈的纳什均衡。为此,我们构建了一种称为的元算法,其可证明以全局线性速率找到纳什均衡。具体而言,通过同伦延拓交织两种基础算法与。是一种具有局部线性收敛的算法,而是一种全局收敛但速率较慢的亚线性算法。通过在这两种基础算法间切换,本质上充当“向导”,识别出享有快速收敛的良好邻域。然而,由于该邻域的精确大小未知,我们采用倍增技巧在两种基础算法间切换。切换方案经过精心设计,使算法的聚合性能由主导。此外,我们证明与均可由乐观梯度下降/上升(OGDA)方法的变体实例化,这具有独立意义。
引用
@article{arxiv.2303.03095,
title = {Can We Find Nash Equilibria at a Linear Rate in Markov Games?},
author = {Zhuoqing Song and Jason D. Lee and Zhuoran Yang},
journal= {arXiv preprint arXiv:2303.03095},
year = {2023}
}
备注
ICLR 2023