无遗憾学习与混合纳什均衡:二者不可兼得
计算机科学与博弈论
2020-10-21 v2 机器学习
最优化与控制
摘要
理解无遗憾动态在一般 N 人博弈中的行为是在线学习与博弈论中的一个基本问题。该领域的一个经验结果表明,在有限博弈中,无遗憾学习下博弈的经验频率收敛到博弈的粗相关均衡集。相比之下,我们对动态的日常行为如何与博弈的纳什均衡相关联的理解要有限得多,并且仅对某些类别的博弈(如零和博弈或拥堵博弈)已知部分结果。在本文中,我们研究“跟随正则化领导者”(follow-the-regularized-leader, FTRL) 的动态,这可以说是最受关注的一类无遗憾动态,并且我们建立了一个广泛的否定结果,表明混合纳什均衡的概念与无遗憾学习相对立。具体而言,我们证明任何非严格的纳什均衡(即每个参与者都有唯一最佳响应)在 FTRL 动态下不可能是稳定且吸引的。这一结果对预测学习过程的结局具有重要意义,因为它明确表明只有严格(因而是纯)纳什均衡能够作为稳定的极限点出现。
引用
@article{arxiv.2010.09514,
title = {No-regret learning and mixed Nash equilibria: They do not mix},
author = {Lampros Flokas and Emmanouil-Vasileios Vlatakis-Gkaragkounis and Thanasis Lianeas and Panayotis Mertikopoulos and Georgios Piliouras},
journal= {arXiv preprint arXiv:2010.09514},
year = {2020}
}
备注
24 pages, 7 figures, 1 table