函数值学习:基于 Polyak 步长与函数拆分的 ERM 自适应学习率
机器学习
2023-07-28 v1 最优化与控制
摘要
本文在此开发了带有自适应步长、利用采样损失值的 SGD(随机梯度下降)变体。具体而言,我们聚焦于求解有限项和问题,亦称经验风险最小化(ERM)。我们首先详述一种称为 的理想化自适应方法,其利用采样损失值并假设已知最优处的采样损失。该 是对 SPS(Stochastic Polyak Stepsize,随机 Polyak 步长)方法的微小修改,其中步长被强制为正。接着我们证明 在 Lipschitz 非光滑情形下取得了 SGD 已知的最佳收敛速率。随后我们开发 ,一种 的变体,其中最优处的损失值被逐步学习而非给定。我们给出 的三种视角:作为基于投影的方法、作为 prox-linear 方法的变体,以及作为一种特定的在线 SGD 方法。然后我们给出 的收敛性分析与实验结果。我们工作的不足之处在于 的收敛分析未显示出优于 SGD 之处。另一不足是当前仅 的全批量版本在步长敏感性方面显示出相对于 GD(梯度下降)的微小优势,随机版本未显示出优于 SGD 的明显优势。我们推测需要大 mini-batch 才能使 具有竞争力。目前本文所研究的新型 方法未提供任何明确理论或实践优势。我们仍选择将本草稿在线公开,是因为我们使用了某些分析技巧,例如对 的非光滑分析,并且也展示了一个当前无效但看似有趣的方法。
引用
@article{arxiv.2307.14528,
title = {Function Value Learning: Adaptive Learning Rates Based on the Polyak Stepsize and Function Splitting in ERM},
author = {Guillaume Garrigos and Robert M. Gower and Fabian Schaipp},
journal= {arXiv preprint arXiv:2307.14528},
year = {2023}
}
备注
38 pages, 2 figures