中文

博弈中后悔匹配算法的末次迭代收敛性质

计算机科学与博弈论 2025-03-05 v2 机器学习

摘要

我们研究了基于后悔匹配+^+ (RM+^+) 的求解二人零和博弈算法的末次迭代收敛性质。尽管它们在求解实际博弈中被广泛使用,但关于其末次迭代收敛性几乎一无所知。分析 RM 型动力学的一个主要障碍是其后悔算子缺乏 Lipschitz 性和(伪)单调性。我们首先通过数值实验表明,实践中使用的若干变体,如 RM+^+、预测 RM+^+ 和交替 RM+^+,即使在简单的 3×33\times 3 矩阵博弈上也都不具备末次迭代收敛保证。随后我们证明,基于平滑技术的这些算法的近期变体——外梯度 RM+^{+} 和平滑预测 RM+^+——具有渐近末次迭代收敛(无速率)、1/t1/\sqrt{t} 最优迭代收敛,并且在结合重启时具有线性速率末次迭代收敛。我们的分析建立在对算法极限点几何结构的新刻画之上,这与大多数关于末次迭代收敛的文献显著不同。我们相信我们的分析可能具有独立意义,并为研究基于非单调算子的算法的末次迭代收敛提供了新视角。

关键词

引用

@article{arxiv.2311.00676,
  title  = {Last-Iterate Convergence Properties of Regret-Matching Algorithms in Games},
  author = {Yang Cai and Gabriele Farina and Julien Grand-Clément and Christian Kroer and Chung-Wei Lee and Haipeng Luo and Weiqiang Zheng},
  journal= {arXiv preprint arXiv:2311.00676},
  year   = {2025}
}

备注

Accepted to ICLR 2025