中文

多玩家一般和博弈中相关均衡的近最优无后悔学习

机器学习 2023-01-26 v3 计算机科学与博弈论

摘要

近来,Daskalakis、Fishelson和Golowich (DFG) (NeurIPS`21) 表明,若多玩家一般和正态形式博弈中的所有智能体采用乐观乘性权重更新(OMWU),则每人在博弈重复 TT 次后的外部后悔为 O(polylog(T))O(\textrm{polylog}(T))。我们将他们的结果从外部后悔扩展到内部后悔和交换后悔,从而建立以 O~(T1)\tilde{O}(T^{-1}) 速率收敛到近似相关均衡的解耦学习动态。这大幅改进了Chen和Peng (NeurIPS`20) 先前相关均衡的最佳收敛速率 O(T3/4)O(T^{-3/4}),并且——在无后悔框架下——关于 TT 的 polylog 因子以内是最优的。为获得这些结果,我们发展了用于建立涉及不动点操作的学习动态的高阶光滑性的新技术。具体而言,我们确立Stoltz和Lugosi (Mach Learn`05) 的无内部后悔学习动态等价于在组合空间上无外部后悔动态的模拟。这使我们能用(行为良好的多的)指数大小集合上的线性变换替代多项式大小马尔可夫链上平稳分布的计算,从而能利用类似DFG的技术近最优地界定内部后悔。此外,我们为Blum和Mansour (BM) (JMLR`07) 的经典算法建立了 O(polylog(T))O(\textrm{polylog}(T)) 无交换后悔界。我们通过引入基于柯西积分公式的技术做到这一点,该技术规避了DFG更受限的组合论证。除了阐明BM的近最优后悔保证外,我们的论证还对DFG技术可被扩展和用于分析更复杂学习算法的多种方式提供了见解。

关键词

引用

@article{arxiv.2111.06008,
  title  = {Near-Optimal No-Regret Learning for Correlated Equilibria in Multi-Player General-Sum Games},
  author = {Ioannis Anagnostides and Constantinos Daskalakis and Gabriele Farina and Maxwell Fishelson and Noah Golowich and Tuomas Sandholm},
  journal= {arXiv preprint arXiv:2111.06008},
  year   = {2023}
}

备注

Appeared at STOC 2022