中文

时变博弈中无后悔学习动态的收敛性

机器学习 2023-10-19 v3 计算机科学与博弈论

摘要

博弈中学习的大部分文献集中于底层重复博弈不随时间变化的限制性设定。关于动态多智能体设定中无后悔学习算法的收敛性所知甚少。本文刻画了时变博弈中乐观梯度下降(OGD)的收敛性。我们的框架针对零和博弈中OGD均衡间隙给出了基于博弈序列自然变化度量的尖锐收敛界,涵盖了静态博弈的已知结果。此外,只要每个博弈被重复多次,我们在强凸-强凹下建立了改进的一阶变化界。我们的结果也通过相关均衡的双线性表述适用于时变一般和多人博弈,这对元学习以及获得精细的依赖于变化的后悔界具有新颖意义,回答了先前论文中遗留的问题。最后,我们利用我们的框架也为静态博弈中的动态后悔保证提供了新见解。

关键词

引用

@article{arxiv.2301.11241,
  title  = {On the Convergence of No-Regret Learning Dynamics in Time-Varying Games},
  author = {Ioannis Anagnostides and Ioannis Panageas and Gabriele Farina and Tuomas Sandholm},
  journal= {arXiv preprint arXiv:2301.11241},
  year   = {2023}
}

备注

To appear at NeurIPS 2023; V3 incorporates reviewers' feedback and minor corrections