博弈中后悔匹配算法的末次迭代收敛性质
计算机科学与博弈论
2025-03-05 v2 机器学习
摘要
我们研究了基于后悔匹配 (RM) 的求解二人零和博弈算法的末次迭代收敛性质。尽管它们在求解实际博弈中被广泛使用,但关于其末次迭代收敛性几乎一无所知。分析 RM 型动力学的一个主要障碍是其后悔算子缺乏 Lipschitz 性和(伪)单调性。我们首先通过数值实验表明,实践中使用的若干变体,如 RM、预测 RM 和交替 RM,即使在简单的 矩阵博弈上也都不具备末次迭代收敛保证。随后我们证明,基于平滑技术的这些算法的近期变体——外梯度 RM 和平滑预测 RM——具有渐近末次迭代收敛(无速率)、 最优迭代收敛,并且在结合重启时具有线性速率末次迭代收敛。我们的分析建立在对算法极限点几何结构的新刻画之上,这与大多数关于末次迭代收敛的文献显著不同。我们相信我们的分析可能具有独立意义,并为研究基于非单调算子的算法的末次迭代收敛提供了新视角。
引用
@article{arxiv.2311.00676,
title = {Last-Iterate Convergence Properties of Regret-Matching Algorithms in Games},
author = {Yang Cai and Gabriele Farina and Julien Grand-Clément and Christian Kroer and Chung-Wei Lee and Haipeng Luo and Weiqiang Zheng},
journal= {arXiv preprint arXiv:2311.00676},
year = {2025}
}
备注
Accepted to ICLR 2025