中文

函数值学习:基于 Polyak 步长与函数拆分的 ERM 自适应学习率

机器学习 2023-07-28 v1 最优化与控制

摘要

本文在此开发了带有自适应步长、利用采样损失值的 SGD(随机梯度下降)变体。具体而言,我们聚焦于求解有限项和问题,亦称经验风险最小化(ERM)。我们首先详述一种称为 SPS+\texttt{SPS}_+ 的理想化自适应方法,其利用采样损失值并假设已知最优处的采样损失。该 SPS+\texttt{SPS}_+ 是对 SPS(Stochastic Polyak Stepsize,随机 Polyak 步长)方法的微小修改,其中步长被强制为正。接着我们证明 SPS+\texttt{SPS}_+ 在 Lipschitz 非光滑情形下取得了 SGD 已知的最佳收敛速率。随后我们开发 FUVAL\texttt{FUVAL},一种 SPS+\texttt{SPS}_+ 的变体,其中最优处的损失值被逐步学习而非给定。我们给出 FUVAL\texttt{FUVAL} 的三种视角:作为基于投影的方法、作为 prox-linear 方法的变体,以及作为一种特定的在线 SGD 方法。然后我们给出 FUVAL\texttt{FUVAL} 的收敛性分析与实验结果。我们工作的不足之处在于 FUVAL\texttt{FUVAL} 的收敛分析未显示出优于 SGD 之处。另一不足是当前仅 FUVAL\texttt{FUVAL} 的全批量版本在步长敏感性方面显示出相对于 GD(梯度下降)的微小优势,随机版本未显示出优于 SGD 的明显优势。我们推测需要大 mini-batch 才能使 FUVAL\texttt{FUVAL} 具有竞争力。目前本文所研究的新型 FUVAL\texttt{FUVAL} 方法未提供任何明确理论或实践优势。我们仍选择将本草稿在线公开,是因为我们使用了某些分析技巧,例如对 SPS+\texttt{SPS}_+ 的非光滑分析,并且也展示了一个当前无效但看似有趣的方法。

关键词

引用

@article{arxiv.2307.14528,
  title  = {Function Value Learning: Adaptive Learning Rates Based on the Polyak Stepsize and Function Splitting in ERM},
  author = {Guillaume Garrigos and Robert M. Gower and Fabian Schaipp},
  journal= {arXiv preprint arXiv:2307.14528},
  year   = {2023}
}

备注

38 pages, 2 figures