中文

多人博弈中具有$O(\log T)$交换遗憾的解耦学习动态

计算机科学与博弈论 2022-10-07 v2 机器学习

摘要

在本文中,我们建立了高效且\emph{解耦}的学习动态,使得当一般和多人博弈中的所有玩家都采用该动态时,每个玩家在博弈重复TT次后的\emph{交换遗憾}被O(logT)O(\log T)所界,优于先前O(log4(T))O(\log^4 (T))的最佳界。同时,我们在对抗情形下也保证了最优的O(T)O(\sqrt{T})交换遗憾。为获得这些结果,我们的主要贡献是证明当所有玩家以\emph{时不变}学习率遵循我们的动态时,动态到时间TT的\emph{二阶路径长度}被O(logT)O(\log T)所界,这是一个基本性质,可能具有超出近最优界定(交换)遗憾的进一步意义。我们提出的学习动态以新颖方式将\emph{乐观}正则化学习与\emph{自协调障碍}的使用相结合。此外,我们的分析异常简单,绕过了Daskalakis、Fishelson和Golowich(NeurIPS'21)近期发展的高阶平滑的繁琐框架。

关键词

引用

@article{arxiv.2204.11417,
  title  = {Uncoupled Learning Dynamics with $O(\log T)$ Swap Regret in Multiplayer Games},
  author = {Ioannis Anagnostides and Gabriele Farina and Christian Kroer and Chung-Wei Lee and Haipeng Luo and Tuomas Sandholm},
  journal= {arXiv preprint arXiv:2204.11417},
  year   = {2022}
}

备注

To appear at NeurIPS 2022. V2 incorporates reviewers' feedback and minor corrections