中文

使用 log-barrier 实现矩阵博弈中最优后迭代收敛——面向 bandit feedback

机器学习 2026-04-17 v1

摘要

我们研究了在零和矩阵博弈中学习 minimax 策略的问题。Fiegel 等人 (2025) 最近证明,在玩家之间无关联的情况下,实现此设置下的后迭代收敛更加困难,通过证明 exploitability gap 的下界为 Omega(t^{-1/4})。文献中提出了一些用于解决此问题的在线镜像梯度算法,但至今尚无算法真正达到了此收敛速率。我们表明,使用 log-barrier 正则化,结合双重聚焦分析,可实现高概率下的 O-tilde(t^{-1/4}) 收敛。我们 additionally 将思路扩展至广义形式博弈 setting,证明了相同速率的下界。

关键词

引用

@article{arxiv.2604.15242,
  title  = {Optimal last-iterate convergence in matrix games with bandit feedback using the log-barrier},
  author = {Come Fiegel and Pierre Menard and Tadashi Kozuno and Michal Valko and Vianney Perchet},
  journal= {arXiv preprint arXiv:2604.15242},
  year   = {2026}
}