通过交替梯度下降-上升实现固定步长下的有限遗憾与循环
计算机科学与博弈论
2019-07-11 v1 动力系统
最优化与控制
摘要
梯度下降可以说是最受欢迎的在线优化方法之一,具有广泛的应用。然而,智能体同时更新策略的标准实现会产生若干不良特性:策略偏离均衡且遗憾随时间增长。在本文中,我们通过引入一种不同的实现方式来消除这些负面特性,从而通过任意固定步长获得有限遗憾。我们通过让智能体轮流更新其策略来获得这一令人惊讶的特性。在此设定下,我们表明使用梯度下降的智能体获得有界遗憾——无论其对手如何更新策略。此外,我们表明在对抗性设定中,当双方都使用交替梯度下降算法时,智能体的策略是有界的并呈现循环。
引用
@article{arxiv.1907.04392,
title = {Finite Regret and Cycles with Fixed Step-Size via Alternating Gradient Descent-Ascent},
author = {James P. Bailey and Gauthier Gidel and Georgios Piliouras},
journal= {arXiv preprint arXiv:1907.04392},
year = {2019}
}
备注
15 pages