中文

我们能否以线性速率在马尔可夫博弈中找到纳什均衡?

计算机科学与博弈论 2023-03-07 v1 机器学习 最优化与控制

摘要

我们研究双人零和折扣马尔可夫博弈中的去中心化学习,其目标是为任一智能体设计满足两个性质的策略优化算法。首先,该玩家无需知晓对手策略即可更新自身策略。其次,当双方均采用该算法时,其联合策略收敛至博弈的纳什均衡。为此,我们构建了一种称为Homotopy-PO\texttt{Homotopy-PO}的元算法,其可证明以全局线性速率找到纳什均衡。具体而言,Homotopy-PO\texttt{Homotopy-PO}通过同伦延拓交织两种基础算法Local-Fast\texttt{Local-Fast}Global-Slow\texttt{Global-Slow}Local-Fast\texttt{Local-Fast}是一种具有局部线性收敛的算法,而Global-Slow\texttt{Global-Slow}是一种全局收敛但速率较慢的亚线性算法。通过在这两种基础算法间切换,Global-Slow\texttt{Global-Slow}本质上充当“向导”,识别出Local-Fast\texttt{Local-Fast}享有快速收敛的良好邻域。然而,由于该邻域的精确大小未知,我们采用倍增技巧在两种基础算法间切换。切换方案经过精心设计,使算法的聚合性能由Local-Fast\texttt{Local-Fast}主导。此外,我们证明Local-Fast\texttt{Local-Fast}Global-Slow\texttt{Global-Slow}均可由乐观梯度下降/上升(OGDA)方法的变体实例化,这具有独立意义。

关键词

引用

@article{arxiv.2303.03095,
  title  = {Can We Find Nash Equilibria at a Linear Rate in Markov Games?},
  author = {Zhuoqing Song and Jason D. Lee and Zhuoran Yang},
  journal= {arXiv preprint arXiv:2303.03095},
  year   = {2023}
}

备注

ICLR 2023