中文

强单调博弈中带赌博机反馈的双重最优无遗憾在线学习

机器学习 2024-04-01 v4 计算机科学与博弈论 最优化与控制

摘要

我们考虑在带赌博机反馈的未知博弈中进行在线无遗憾学习,其中每个玩家在每个时刻只能观测其奖励——由所有玩家当前联合动作决定——而非其梯度。我们关注一类光滑且强单调博弈,并研究其中的最优无遗憾学习。利用自协调障碍函数,我们首先构建了一种新的赌博机学习算法,并证明在光滑且强凹的奖励函数下(n1n \geq 1 为问题维度),它实现了单智能体最优遗憾 Θ~(nT)\tilde{\Theta}(n\sqrt{T})。接着我们证明,若每个玩家在强单调博弈中应用该无遗憾学习算法,联合动作将在末次迭代以 Θ~(nT1/2)\tilde{\Theta}(nT^{-1/2}) 的速率收敛到唯一纳什均衡。在我们工作之前,同类博弈中已知最佳收敛速率为 O~(n2/3T1/3)\tilde{O}(n^{2/3}T^{-1/3})(由不同算法实现),从而留下了最优无遗憾学习算法的开放问题(因为已知下界为 Ω(nT1/2)\Omega(nT^{-1/2}))。我们的结果因此解决了该开放问题,并通过确定首个双重最优赌博机学习算法——即(直至对数因子)同时实现单智能体学习的最优遗憾和多智能体学习的最优末次迭代收敛速率——丰富了博弈论学习的广阔图景。我们还给出了若干应用问题上的初步数值结果,以证明我们的算法在迭代次数方面的有效性。

关键词

引用

@article{arxiv.2112.02856,
  title  = {Doubly Optimal No-Regret Online Learning in Strongly Monotone Games with Bandit Feedback},
  author = {Wenjia Ba and Tianyi Lin and Jiawei Zhang and Zhengyuan Zhou},
  journal= {arXiv preprint arXiv:2112.02856},
  year   = {2024}
}

备注

43 pages, 4 figures