中文

关于游戏中学习的最优迭代、随机迭代与末迭代收敛之间的分离

机器学习 2025-03-05 v1 计算机科学与博弈论 最优化与控制

摘要

游戏中学习动力学的非遍历收敛近期受到广泛关注,因其在理论和实践中的重要性。近期工作(Cai et al., 2024)表明,一大类学习动力系统,包括乐观乘法权重更新(OMWU),即使在简单的 2×22 \times 2 矩阵博弈中也能展现出任意缓慢的末迭代收敛,尽管这些动力系统已知在末迭代意义下渐近收敛。然而,尚不清楚这些算法在较弱准则下(如最优迭代收敛)是否能实现快速非遍历收敛。我们证明对于 2×22\times 2 矩阵博弈,OMWU实现了 O(T1/6)O(T^{-1/6}) 的最优迭代收敛率,这与其在同一类博弈中缓慢的末迭代收敛形成鲜明对比。此外,我们建立了一个下界,表明OMWU未达到任何多项式级别的随机迭代收敛率,该收敛率由所有迭代上的期望对偶间隙来衡量。这一结果挑战了随机迭代收敛本质上等价于最优迭代收敛的传统观点,后者常被用作建立前者的代理。我们的分析揭示了与动态遗憾的新联系,并提出了一种最优迭代收敛的两阶段方法,该方法可能具有独立的研究价值。

关键词

引用

@article{arxiv.2503.02825,
  title  = {On Separation Between Best-Iterate, Random-Iterate, and Last-Iterate Convergence of Learning in Games},
  author = {Yang Cai and Gabriele Farina and Julien Grand-Clément and Christian Kroer and Chung-Wei Lee and Haipeng Luo and Weiqiang Zheng},
  journal= {arXiv preprint arXiv:2503.02825},
  year   = {2025}
}

备注

33 pages