参数优化中随机梯度下降的导数
最优化与控制
2024-11-21 v2 机器学习
摘要
我们考虑随机优化问题,其中目标依赖于某个参数,这在超参数优化中常见。我们研究了随机梯度下降(SGD)迭代关于该参数的导数行为,并表明它们由另一个目标函数上的不精确SGD递归驱动,并受到原始SGD收敛的扰动。这使我们能够建立:当目标强凸时,SGD的导数以均方误差收敛到解映射的导数。具体地,我们证明在常数步长下,这些导数稳定在解导数周围的噪声球内;在递减步长下,它们表现出的收敛速率。此外,我们证明了在插值情况下的指数收敛。我们的理论发现通过合成任务的数值实验得到了说明。
引用
@article{arxiv.2405.15894,
title = {Derivatives of Stochastic Gradient Descent in parametric optimization},
author = {Franck Iutzeler and Edouard Pauwels and Samuel Vaiter},
journal= {arXiv preprint arXiv:2405.15894},
year = {2024}
}