随机 Steffensen 方法
最优化与控制
2022-11-29 v1 机器学习
摘要
一阶方法(即仅允许使用一阶导数)能否实现二次收敛?对于单变量损失函数,答案是肯定的——Steffensen 方法避免了二阶导数,但仍像牛顿法一样具有二次收敛性。通过引入最优步长,我们甚至可以将其收敛阶提升至超过二次,达到 。虽然如此高的收敛阶对于确定性算法而言是一种无意义的过度设计,但当算法被随机化以处理大规模问题时,它们便变得极具价值,因为随机化不可避免地会损害收敛速度。我们将引入两种受 Steffensen 方法启发的自适应学习率,它们旨在用于随机优化环境,且除了批量大小外无需任何超参数调整。大量实验表明,它们与若干现有的一阶方法相比表现更优。当目标函数限定为二次函数时,我们的随机 Steffensen 方法退化为随机 Kaczmarz 方法——请注意,这对于 SGD 或 SLBFGS 并不成立——因此,我们也可以将我们的方法视为随机 Kaczmarz 方法向任意目标函数的推广。
引用
@article{arxiv.2211.15310,
title = {Stochastic Steffensen method},
author = {Minda Zhao and Zehua Lai and Lek-Heng Lim},
journal= {arXiv preprint arXiv:2211.15310},
year = {2022}
}
备注
22 pages, 3 figures