中文

一般凸博弈的近最优无遗憾学习动力学

计算机科学与博弈论 2022-10-18 v3 机器学习

摘要

近期一系列工作建立了非耦合学习动力学,当博弈中所有参与者均采用时,每个参与者的遗憾(regret)在TT次重复后关于TT多对数增长,这相比无遗憾框架内的传统保证是指数级改进。然而,迄今为止这些结果仅局限于具有结构化策略空间的某些博弈类——例如标准型和扩展型博弈。对于一般的凸且紧的策略集(其出现在经济学和多智能体系统的许多基本模型中)能否在保持高效策略更新的同时获得O(polylogT)O(\text{polylog} T)遗憾界,是一个重要问题。在本文中,我们肯定地回答了该问题,建立了首个在一般凸博弈中具有O(logT)O(\log T)每参与者遗憾的非耦合学习算法,即具有定义在任意凸且紧策略集上的凹效用函数的博弈。我们的学习动力学基于在适当提升的空间上使用一种自协和正则化项(奇特地,它并非可行域的障碍函数)的乐观跟随正则化领导者(optimistic follow-the-regularized-leader)实例化。此外,给定凸策略集的邻近预言机,我们的学习动力学可高效实现,带来O(loglogT)O(\log\log T)每次迭代复杂度;我们也给出了仅假设线性优化预言机可用时的扩展。最后,我们调整了我们的动力学以在对抗情形下保证O(T)O(\sqrt{T})遗憾。即便在先前结果适用的那些特例中,我们的算法在迭代次数依赖或策略集维度依赖上均优于最先进的遗憾界。

关键词

引用

@article{arxiv.2206.08742,
  title  = {Near-Optimal No-Regret Learning Dynamics for General Convex Games},
  author = {Gabriele Farina and Ioannis Anagnostides and Haipeng Luo and Chung-Wei Lee and Christian Kroer and Tuomas Sandholm},
  journal= {arXiv preprint arXiv:2206.08742},
  year   = {2022}
}

备注

To appear at NeurIPS 2022. V2 incorporates reviewers' feedback