中文

关于计算稀疏均衡的复杂性及博弈中无遗憾学习的下界

计算机科学与博弈论 2023-11-28 v1

摘要

刻画多玩家博弈中无遗憾动态的绩效,是在线学习与博弈论交叉领域的一个基础性问题。近期结果表明,当所有玩家采用特定学习算法时,有可能较传统对抗机制下过度悲观的无遗憾框架所预测的改进指数级,从而更快收敛至粗相关均衡(CCE)集合。然而,尽管近期取得可观进展,正常形与扩展形博弈中学习的根本复杂性障碍仍鲜为人知。在本文中,我们朝弥合此差距迈出一步:首先证明——除非重大复杂性突破——扩展形博弈中任何多项式时间学习算法均需至少2log1/2o(1)T2^{\log^{1/2 - o(1)} |\mathcal{T}|}次迭代才能使平均遗憾降至即便绝对常数以下,其中T|\mathcal{T}|为博弈中节点数。这确立了正常形与扩展形博弈中无遗憾学习间的超多项式分离,因在前一类中对数次迭代即足以实现常数平均遗憾。此外,我们的结果意味着,如乘性权重更新及其\emph{乐观}变体等算法,在mm动作正常形博弈中需至少2(loglogm)1/2o(1)2^{(\log \log m)^{1/2 - o(1)}}次迭代以达到O(1)O(1)-CCE。这些是文献中研究最深入的算法在该设定下首个非平凡且依赖维度的下界。从技术角度,我们遵循Foster、Golowich与Kakade(ICML '23)近期建立的稀疏CCE与Markov博弈中Nash均衡间的优美联系。因此,我们的下界排除了远超传统在线学习框架的多项式时间算法。

关键词

引用

@article{arxiv.2311.14869,
  title  = {On the Complexity of Computing Sparse Equilibria and Lower Bounds for No-Regret Learning in Games},
  author = {Ioannis Anagnostides and Alkis Kalavasis and Tuomas Sandholm and Manolis Zampetakis},
  journal= {arXiv preprint arXiv:2311.14869},
  year   = {2023}
}

备注

To appear at ITCS 2024