中文

快速最后迭代收敛需要忘记算法:学习在博弈中的收敛性分析

计算机科学与博弈论 2025-01-22 v2 机器学习 最优化与控制

摘要

通过在线学习进行自我对弈是解决大规模双人零和博弈的首选方法,既在理论上也在实践中都表现出色。 particularly popular 的算法包括乐观乘性权重更新(OMWU)和乐观梯度下降-上升(OGDA)。虽然两种算法在双人零和博弈中都能实现 O(1/T)O(1/T) 的 Ergodic 收敛到纳什均衡,但 OMWU 具有若干优势,包括对 payoff 矩阵大小的对数依赖,以及即使在一般和博弈中也能实现 O~(1/T)\widetilde{O}(1/T) 收敛到粗相关均衡。然而,就双人零和博弈中的最后迭代收敛而言,近年来该领域的热门话题之一是 OGDA 保证了对偶间隙收敛速率为 O(1/T)O(1/\sqrt{T}),而 OMWU 最佳现有最后迭代收敛结果取决于某个可能任意大的博弈相关常数。这引发了一个问题:这种潜在的缓慢最后迭代收敛是 OMWU 的固有劣势,还是当前分析过于松散?有趣的是,我们证明了前者是正确的。更一般地,我们证明了一类不快速忘记过去的算法都会遭受相同问题:对于任意最小的 δ>0\delta>0,存在一个 2×22\times 2 矩阵博弈,使得该算法在进行 1/δ1/\delta 轮后仍然保持常数对偶间隙。该类算法包括 OMWU 和其他标准的乐观跟随-正则化领域算法。

关键词

引用

@article{arxiv.2406.10631,
  title  = {Fast Last-Iterate Convergence of Learning in Games Requires Forgetful Algorithms},
  author = {Yang Cai and Gabriele Farina and Julien Grand-Clément and Christian Kroer and Chung-Wei Lee and Haipeng Luo and Weiqiang Zheng},
  journal= {arXiv preprint arXiv:2406.10631},
  year   = {2025}
}

备注

Accepted to NeurIPS 2024