中文

零和随机博弈中基于收益的独立学习的有限样本分析

计算机科学与博弈论 2023-03-07 v1 机器学习

摘要

我们研究二人零和随机博弈,并提出一种称为双重平滑最佳响应动力学的独立学习动力学形式,该动力学将最佳响应动力学的离散双重平滑变体集成到时序差分(TD)学习与极小极大值迭代中。所得动力学是基于收益的、收敛的、理性的,且在玩家间对称。我们的主要结果给出了有限样本保证。特别地,我们证明了已知的第一个 O~(1/ϵ2)\tilde{\mathcal{O}}(1/\epsilon^2) 基于收益的独立学习动力学样本复杂度界(直至平滑偏差)。在随机博弈仅有一个状态(即矩阵博弈)的特殊情形下,我们给出更紧的 O~(1/ϵ)\tilde{\mathcal{O}}(1/\epsilon) 样本复杂度。我们的分析使用了一种新颖的耦合李雅普诺夫漂移方法以刻画多组耦合随机迭代的演化,这本身可能具有独立意义。

关键词

引用

@article{arxiv.2303.03100,
  title  = {A Finite-Sample Analysis of Payoff-Based Independent Learning in Zero-Sum Stochastic Games},
  author = {Zaiwei Chen and Kaiqing Zhang and Eric Mazumdar and Asuman Ozdaglar and Adam Wierman},
  journal= {arXiv preprint arXiv:2303.03100},
  year   = {2023}
}