Polyak-Łojasiewicz 条件下梯度法与邻近梯度法的线性收敛性
机器学习
2020-09-15 v4 最优化与控制
统计计算
机器学习
摘要
1963 年,Polyak 提出了一个简单条件,足以证明梯度下降的全局线性收敛速率。该条件是同年提出的 Łojasiewicz 不等式的一个特例,且不要求强凸性(甚至不要求凸性)。本文中,我们证明这一更早提出的 Polyak-Łojasiewicz (PL) 不等式实际上弱于过去 25 年中为证明无强凸性时的线性收敛速率而探索的主要条件。我们还利用 PL 不等式,对随机化坐标下降法、贪婪坐标下降法、基于符号的梯度下降法,以及经典设定(采用递减或恒定步长)与方差缩减设定下的随机梯度方法,给出了新的分析。我们进一步提出了一种推广,适用于非光滑优化的邻近梯度法,从而为这些方法的线性收敛性提供了简洁证明。在此过程中,我们为机器学习中广泛多样的各类问题给出了简单的收敛性结果:最小二乘、逻辑回归、提升方法、弹性反向传播、L1 正则化、支持向量机、随机对偶坐标上升以及随机方差缩减梯度方法。
引用
@article{arxiv.1608.04636,
title = {Linear Convergence of Gradient and Proximal-Gradient Methods Under the Polyak-\L{}ojasiewicz Condition},
author = {Hamed Karimi and Julie Nutini and Mark Schmidt},
journal= {arXiv preprint arXiv:1608.04636},
year = {2020}
}
备注
[v4]: Fixes a constant factor in the PL-->QG proof, which also simplifies the PL-->EB proof and implies that PL implies EB and QB with the same constant