多人博弈中具有$O(\log T)$交换遗憾的解耦学习动态
计算机科学与博弈论
2022-10-07 v2 机器学习
摘要
在本文中,我们建立了高效且\emph{解耦}的学习动态,使得当一般和多人博弈中的所有玩家都采用该动态时,每个玩家在博弈重复次后的\emph{交换遗憾}被所界,优于先前的最佳界。同时,我们在对抗情形下也保证了最优的交换遗憾。为获得这些结果,我们的主要贡献是证明当所有玩家以\emph{时不变}学习率遵循我们的动态时,动态到时间的\emph{二阶路径长度}被所界,这是一个基本性质,可能具有超出近最优界定(交换)遗憾的进一步意义。我们提出的学习动态以新颖方式将\emph{乐观}正则化学习与\emph{自协调障碍}的使用相结合。此外,我们的分析异常简单,绕过了Daskalakis、Fishelson和Golowich(NeurIPS'21)近期发展的高阶平滑的繁琐框架。
引用
@article{arxiv.2204.11417,
title = {Uncoupled Learning Dynamics with $O(\log T)$ Swap Regret in Multiplayer Games},
author = {Ioannis Anagnostides and Gabriele Farina and Christian Kroer and Chung-Wei Lee and Haipeng Luo and Tuomas Sandholm},
journal= {arXiv preprint arXiv:2204.11417},
year = {2022}
}
备注
To appear at NeurIPS 2022. V2 incorporates reviewers' feedback and minor corrections