中文

面向扩展式相关均衡与粗相关均衡的更快无遗憾学习动态

计算机科学与博弈论 2022-02-14 v1

摘要

近期博弈学习文献中的一个新兴趋势致力于为正规形式博弈中的相关均衡与粗相关均衡提供更快的学习动态。对于可同时刻画序列与同步行动以及不完美信息的扩展式博弈这一更具挑战性的设定,人们所知甚少。本文针对多人一般和不完全信息扩展式博弈中的扩展式相关均衡(EFCE)建立了更快的无遗憾学习动态。当所有玩家均遵循我们的加速动态时,博弈的相关分布是一个 O(T3/4)O(T^{-3/4}) 近似 EFCE,其中 O()O(\cdot) 记号隐去了关于博弈描述的多项式参数。这显著优于先前最佳的 O(T1/2)O(T^{-1/2}) 速率。为实现此目标,我们开发了一个通过预测执行加速 Phi-遗憾最小化(Phi-regret minimization)的框架。我们的关键技术贡献之一——使我们能采用通用模板——是通过对结构化马尔可夫链的精细扰动分析来刻画与触发偏离函数(trigger deviation functions)相关的不动点的稳定性。此外,对于扩展式粗相关均衡(EFCCE)这一更简单的均衡概念,我们给出了相关不动点的一种新的简洁闭式刻画,从而规避了 EFCE 所需的平稳分布昂贵计算。我们的结果在每次迭代复杂度方面将 EFCCE 置于更接近正规形式粗相关均衡的位置,尽管前者给出了更具说服力的相关性概念。最后,在标准基准上进行的实验印证了我们的理论发现。

关键词

引用

@article{arxiv.2202.05446,
  title  = {Faster No-Regret Learning Dynamics for Extensive-Form Correlated and Coarse Correlated Equilibria},
  author = {Ioannis Anagnostides and Gabriele Farina and Christian Kroer and Andrea Celli and Tuomas Sandholm},
  journal= {arXiv preprint arXiv:2202.05446},
  year   = {2022}
}

备注

Preliminary parts of this paper will appear at the AAAI-22 Workshop on Reinforcement Learning in Games. This version also contains results from an earlier preprint published by a subset of the authors (arXiv:2109.08138)