中文

单调博弈中镜像博弈的变分解释

计算机科学与博弈论 2024-03-26 v1 系统与控制 系统与控制

摘要

镜像博弈(MP)是一种被广泛接受的原始-对偶多智能体学习算法,其中所有智能体以分布式方式同时实现镜像下降。MP相对于原始梯度博弈的优势在于它使用了镜像映射,更好地利用了决策域的几何结构。尽管有大量文献致力于MP向均衡的渐近收敛,但对MP在达到均衡前的有限时间行为的理解仍然初步。为了促进对MP非均衡性能的研究,本文建立了单调博弈中MP的有限时间原始-对偶路径(镜像路径)与有限时域微分博弈的闭环纳什均衡路径之间的等价性,该微分博弈称为镜像微分博弈(MDG)。我们的MDG构造基于Brezis-Ekeland变分原理,MDG的阶段成本泛函是MP迭代与相关梯度更新之间的Fenchel耦合。静态博弈中镜像路径作为MDG中均衡路径的变分解释在确定性和随机情况下都成立。这种变分解释将学习动态的非均衡研究转化为更易处理的动态博弈均衡分析,如Cournot博弈的案例研究所示,其中MP动态对应于线性二次博弈。

关键词

引用

@article{arxiv.2403.15636,
  title  = {On the Variational Interpretation of Mirror Play in Monotone Games},
  author = {Yunian Pan and Tao Li and Quanyan Zhu},
  journal= {arXiv preprint arXiv:2403.15636},
  year   = {2024}
}