中文

随机 Steffensen 方法

最优化与控制 2022-11-29 v1 机器学习

摘要

一阶方法(即仅允许使用一阶导数)能否实现二次收敛?对于单变量损失函数,答案是肯定的——Steffensen 方法避免了二阶导数,但仍像牛顿法一样具有二次收敛性。通过引入最优步长,我们甚至可以将其收敛阶提升至超过二次,达到 1+22.4141+\sqrt{2} \approx 2.414。虽然如此高的收敛阶对于确定性算法而言是一种无意义的过度设计,但当算法被随机化以处理大规模问题时,它们便变得极具价值,因为随机化不可避免地会损害收敛速度。我们将引入两种受 Steffensen 方法启发的自适应学习率,它们旨在用于随机优化环境,且除了批量大小外无需任何超参数调整。大量实验表明,它们与若干现有的一阶方法相比表现更优。当目标函数限定为二次函数时,我们的随机 Steffensen 方法退化为随机 Kaczmarz 方法——请注意,这对于 SGD 或 SLBFGS 并不成立——因此,我们也可以将我们的方法视为随机 Kaczmarz 方法向任意目标函数的推广。

关键词

引用

@article{arxiv.2211.15310,
  title  = {Stochastic Steffensen method},
  author = {Minda Zhao and Zehua Lai and Lek-Heng Lim},
  journal= {arXiv preprint arXiv:2211.15310},
  year   = {2022}
}

备注

22 pages, 3 figures