嵌套你的自适应算法以实现参数无关的非凸极小极大优化
最优化与控制
2022-10-17 v2 机器学习
机器学习
摘要
AdaGrad 和 AMSGrad 等自适应算法在非凸优化中取得成功,归功于其参数无关能力——无需关于问题特定参数的先验知识,也无需调整学习率。然而,在非凸极小极大优化中,此类自适应优化器若无恰当的时间尺度分离,直接扩展可能在实践中失效。我们给出一个例子证明:若原对偶步长比未被仔细选择,梯度下降上升(GDA)与自适应步长的简单组合可能发散;因此,此类自适应扩展绝非参数无关的。为解决问题,我们正式引入一种嵌套自适应框架,简称 NeAda,其携带一个用可控停止准则自适应最大化对偶变量的内循环,以及一个自适应最小化原变量的外循环。该机制可配备现成自适应优化器,并自动平衡原变量与对偶变量的进展。理论上,对于非凸-强凹极小极大问题,我们证明 NeAda 可在确定性与随机设定下分别达到近最优的 与 梯度复杂度,且无需问题的光滑性与强凹参数的先验信息。据我们所知,这是首个在非凸极小极大设定中同时实现近最优收敛率与参数无关自适应的算法。数值上,我们通过在简单测试函数与真实应用上的实验进一步说明了 NeAda 族的鲁棒性。
引用
@article{arxiv.2206.00743,
title = {Nest Your Adaptive Algorithm for Parameter-Agnostic Nonconvex Minimax Optimization},
author = {Junchi Yang and Xiang Li and Niao He},
journal= {arXiv preprint arXiv:2206.00743},
year = {2022}
}
备注
v2: fixed typos and improved Theorem 3.4