中文

多人游戏中无悔学习的紧致末次迭代收敛速率

机器学习 2020-10-27 v1 最优化与控制

摘要

我们研究在多人游戏中获得无悔学习算法的末次迭代收敛速率的问题。我们表明,具有常数步长且无悔的乐观梯度(OG)算法,在光滑单调博弈中相对于间隙函数实现了O(1/T)O(1/\sqrt{T})的末次迭代速率。该结果回应了Mertikopoulos & Zhou(2018)的问题,他们询问是否可应用外梯度方法(如OG)在多智能体学习设定中实现改进的保证。我们上界的证明使用了一种以每次迭代势函数的自适应选择为中心的新技术。我们还表明O(1/T)O(1/\sqrt{T})速率对所有pp-SCLI算法是紧的,此类算法包含OG作为特例。作为下界分析的副产品,我们还给出了Arjevani等人(2015)一个猜想的证明,其比先前方法更为直接。

关键词

引用

@article{arxiv.2010.13724,
  title  = {Tight last-iterate convergence rates for no-regret learning in multi-player games},
  author = {Noah Golowich and Sarath Pattathil and Constantinos Daskalakis},
  journal= {arXiv preprint arXiv:2010.13724},
  year   = {2020}
}

备注

To appear at NeurIPS 2020. 41 pages