双线性零和博弈中前瞻型最优响应乘性权重更新方法
计算机科学与博弈论
2022-03-09 v3 机器学习
摘要
我们的工作聚焦于用于寻找双线性零和博弈中纳什均衡的额外梯度学习算法。所提出的方法可形式地视为乐观镜像下降(Optimistic Mirror Descent,见\cite{DBLP:conf/iclr/MertikopoulosLZ19})的一种变体,其对中间梯度步使用较大学习率,这本质上导致针对前一次迭代的策略轮廓计算(近似)最优响应策略。尽管初看有违直觉——对于一个迭代算法而言中间学习步大得不合理——我们证明该方法保证了末次迭代收敛到均衡。特别地,我们表明算法首先达到一个近似纳什均衡,其中,通过将每次迭代的Kullback-Leibler散度至少降低(对于足够小的学习率)直到该方法成为压缩映射,并收敛到精确均衡。此外,我们与\cite{Daskalakis2019LastIterateCZ}的乘性权重更新方法的乐观变体进行了实验比较,并表明我们的算法具有显著的实际潜力,因其在加速收敛方面提供了可观收益。
引用
@article{arxiv.2106.03579,
title = {Forward Looking Best-Response Multiplicative Weights Update Methods for Bilinear Zero-sum Games},
author = {Michail Fasoulakis and Evangelos Markakis and Yannis Pantazis and Constantinos Varsos},
journal= {arXiv preprint arXiv:2106.03579},
year = {2022}
}