快速最后迭代收敛需要忘记算法:学习在博弈中的收敛性分析
计算机科学与博弈论
2025-01-22 v2 机器学习
最优化与控制
摘要
通过在线学习进行自我对弈是解决大规模双人零和博弈的首选方法,既在理论上也在实践中都表现出色。 particularly popular 的算法包括乐观乘性权重更新(OMWU)和乐观梯度下降-上升(OGDA)。虽然两种算法在双人零和博弈中都能实现 的 Ergodic 收敛到纳什均衡,但 OMWU 具有若干优势,包括对 payoff 矩阵大小的对数依赖,以及即使在一般和博弈中也能实现 收敛到粗相关均衡。然而,就双人零和博弈中的最后迭代收敛而言,近年来该领域的热门话题之一是 OGDA 保证了对偶间隙收敛速率为 ,而 OMWU 最佳现有最后迭代收敛结果取决于某个可能任意大的博弈相关常数。这引发了一个问题:这种潜在的缓慢最后迭代收敛是 OMWU 的固有劣势,还是当前分析过于松散?有趣的是,我们证明了前者是正确的。更一般地,我们证明了一类不快速忘记过去的算法都会遭受相同问题:对于任意最小的 ,存在一个 矩阵博弈,使得该算法在进行 轮后仍然保持常数对偶间隙。该类算法包括 OMWU 和其他标准的乐观跟随-正则化领域算法。
引用
@article{arxiv.2406.10631,
title = {Fast Last-Iterate Convergence of Learning in Games Requires Forgetful Algorithms},
author = {Yang Cai and Gabriele Farina and Julien Grand-Clément and Christian Kroer and Chung-Wei Lee and Haipeng Luo and Weiqiang Zheng},
journal= {arXiv preprint arXiv:2406.10631},
year = {2025}
}
备注
Accepted to NeurIPS 2024