指数权重动态下对称、一般和 $2 \times 2$ 游戏的最后迭代收敛性
计算机科学与博弈论
2026-01-22 v3 机器学习
摘要
我们对离散时间指数权重动态(带常数步长)进行全面分析,适用于所有一般和对称 常规形式游戏,即每位玩家有2种纯策略,且 resulting payoff tuple 形式为(A,A^⊤)。此类对称游戏常见于具有相同效用函数的'对称'智能体之间的真实世界相互作用中——如伯特垄竞争和多智能体表现性预测,尽管设置看似简单,却显示出丰富的平衡态。有趣的是,我们通过从原理出发的分析表明,指数权重动态——一种在在线学习中广受欢迎的方法——无论初始化方式如何,都能在合适的步长下实现最后迭代收敛。对于某些游戏和/或初始化方式,我们进一步表明收敛速率实际上是指数级的,并且对任何步长都成立。我们通过大量仿真和应用于上述游戏论相互作用来说明我们的理论。在多智能体表现性预测的情况下,我们构建一个新的'抵押品竞争'游戏,其中贷款人(银行)与来自客户 population 互动,表明该模型符合我们的框架。
引用
@article{arxiv.2502.08063,
title = {Last-iterate Convergence for Symmetric, General-sum, $2 \times 2$ Games Under The Exponential Weights Dynamic},
author = {Guanghui Wang and Krishna Acharya and Lokranjan Lakshmikanthan and Juba Ziani and Vidya Muthukumar},
journal= {arXiv preprint arXiv:2502.08063},
year = {2026}
}