关于时变零和博弈中的末次迭代收敛:额外梯度成功而乐观梯度失败之处
计算机科学与博弈论
2023-10-05 v1
摘要
末次迭代收敛在双人零和博弈中得到了广泛研究,从双线性、凸-凹到满足 MVI 条件的设定。展现上述博弈末次迭代收敛的典型方法包括额外梯度(Extra-Gradient, EG)和乐观梯度下降上升(Optimistic Gradient Descent Ascent, OGDA)。然而,所有已建立的末次迭代收敛结果都适用于底层重复博弈不随时间变化的受限设定。近来,一系列研究聚焦于 OGDA 在时变博弈(即收益随时间演化的博弈)中的后悔分析;但 OGDA 和 EG 在时变环境中的末次迭代行为仍不清楚。在本文中,我们研究了多种算法在两类无约束、时变、双线性零和博弈中的末次迭代行为:周期博弈与收敛扰动博弈。这些模型扩展了通常的重复博弈形式,并纳入了外部环境因子,例如物种竞争的季节性效应和逐渐消失的外部噪声。在周期博弈中,我们证明 EG 会收敛而 OGDA 和动量法会发散。这颇为令人惊讶,因为据我们所知,这是首个表明 EG 与 OGDA 具有定性不同的末次迭代行为且未展现相似行为的结果。在收敛扰动博弈中,我们证明只要博弈本身以快于 的速率稳定下来,所有这些算法都会收敛。
引用
@article{arxiv.2310.02604,
title = {On the Last-iterate Convergence in Time-varying Zero-sum Games: Extra Gradient Succeeds where Optimism Fails},
author = {Yi Feng and Hu Fu and Qun Hu and Ping Li and Ioannis Panageas and Bo Peng and Xiao Wang},
journal= {arXiv preprint arXiv:2310.02604},
year = {2023}
}
备注
44 pages, accepted for NeurIPS 2023