中文

零和随机博弈中基于收益的独立学习的最后迭代收敛性

机器学习 2024-09-06 v2 计算机科学与博弈论

摘要

本文我们考虑两人零和矩阵和随机博弈,发展出基于收益的学习动力学,这些动力学是收敛的、合理的、对称的,两个玩家之间如此。具体而言,矩阵博弈的学习动力学基于平滑最佳响应动力学,而随机博弈的学习动力学建立在矩阵博弈的动力学之上,额外融入了最小混合值迭代。就我们已知的而言,我们的理论结果是首次对此类学习动力学进行有限样本分析,并具有最后迭代保证。在矩阵博弈设置下,结果意味着找到 Nash 分布的样本复杂度为 O(ϵ1)O(\epsilon^{-1}),找到 Nash 均衡的样本复杂度为 O(ϵ8)O(\epsilon^{-8})。在随机博弈设置下,结果也意味着找到 Nash 均衡的样本复杂度为 O(ϵ8)O(\epsilon^{-8})。为建立这些结果,主要挑战是处理具有多个 coupled 和随机迭代集合的随机逼近算法,这些迭代集合可能在(可能)不同的时间尺度上演化。在克服这一挑战方面,我们发展了基于耦合 Lyapunov 方法,这可能对更广泛的社区感兴趣,他们正在研究随机逼近算法的收敛行为。

关键词

引用

@article{arxiv.2409.01447,
  title  = {Last-Iterate Convergence of Payoff-Based Independent Learning in Zero-Sum Stochastic Games},
  author = {Zaiwei Chen and Kaiqing Zhang and Eric Mazumdar and Asuman Ozdaglar and Adam Wierman},
  journal= {arXiv preprint arXiv:2409.01447},
  year   = {2024}
}

备注

A preliminary version [arXiv:2303.03100] of this paper, with a subset of the results that are presented here, was presented at NeurIPS 2023