中文

从平均迭代到最后迭代收敛:一种简化及其应用

计算机科学与博弈论 2025-11-11 v2 机器学习 最优化与控制

摘要

在游戏中在自我对弈下进行的在线学习算法的收敛是博弈论和机器学习中的一个基本问题。在各种收敛概念中,最后迭代收敛尤为理想,因为它反映了学习者实际的决策,捕捉学习动态的日常行为。虽然许多算法已知在平均迭代上收敛,但要实现最后迭代收敛,通常需要在算法的设计和分析中付出相当大的努力。我们惊讶地在本文中展示,对于大型游戏族,存在一种简单的黑箱简化,可将未耦合学习动力学的平均迭代转换为新的未耦合学习动力学的最后迭代,从而也提供了从最后迭代收敛到平均迭代收敛的简化。我们的简化适用于每位玩家的效用在其自身策略以及所有对手的联合策略上均为线性的游戏。该族包括两人双矩阵游戏及其 generalizations 如多人多矩阵游戏。通过将我们的简化应用于乐观乘性权重更新算法,我们获得了针对多人零和多矩阵游戏中非耦合学习动力学的新的最先进最后迭代收敛率:(1) 在梯度反馈下,O(logdT)O(\frac{\log d}{T})的最后迭代收敛率,表明在策略维数dd(即任一玩家可用的最大动作数)上的指数级改进;(2) 在bandit反馈下,O~(d15T15)\widetilde{O}(d^{\frac{1}{5}} T^{-\frac{1}{5}})的最后迭代收敛率,超越了之前最佳率O~(dT18)\widetilde{O}(\sqrt{d} T^{-\frac{1}{8}})O~(dT16)\widetilde{O}(\sqrt{d} T^{-\frac{1}{6}})

关键词

引用

@article{arxiv.2506.03464,
  title  = {From Average-Iterate to Last-Iterate Convergence in Games: A Reduction and Its Applications},
  author = {Yang Cai and Haipeng Luo and Chen-Yu Wei and Weiqiang Zheng},
  journal= {arXiv preprint arXiv:2506.03464},
  year   = {2025}
}

备注

NeurIPS 2025. 24 pages. Updated version with more discussions and robustness in the bandit feedback setting