中文

博弈中多智能体学习的有限时间末次迭代收敛

最优化与控制 2021-07-20 v5 计算机科学与博弈论 机器学习

摘要

本文考虑一类称为 λ\lambda-cocoercive 博弈(一类相当广泛的博弈,允许多个纳什均衡,且恰当地包含了无约束强单调博弈)中通过在线梯度下降进行的多智能体学习。我们刻画了在 λ\lambda-cocoercive 博弈上联合OGD学习的有限时间末次迭代收敛速率;进一步,基于此结果,我们开发了完全自适应的OGD学习算法,无需任何问题参数(如cocoercive常数 λ\lambda)的知识,并通过一种新颖的双停止时间技术证明该自适应算法取得了与非自适应对应算法相同的有限时间末次迭代收敛速率。随后,我们将OGD学习扩展到噪声梯度反馈情形,并在非递减步长下建立了末次迭代收敛结果——首先是定性的几乎必然收敛,然后是定量的有限时间收敛速率。据我们所知,我们提供的结果首次填补了现有多智能体在线学习文献中的若干空白,其中有限时间收敛速率、非递减步长以及完全自适应算法这三个方面此前均未被探索。

关键词

引用

@article{arxiv.2002.09806,
  title  = {Finite-Time Last-Iterate Convergence for Multi-Agent Learning in Games},
  author = {Tianyi Lin and Zhengyuan Zhou and Panayotis Mertikopoulos and Michael I. Jordan},
  journal= {arXiv preprint arXiv:2002.09806},
  year   = {2021}
}

备注

Accepted by ICML 2020; The first two authors contributed equally to this work