中文

具有衰减步长的 SGD 在过参数化线性回归上的末次迭代风险界

机器学习 2022-07-12 v2 最优化与控制 机器学习

摘要

随机梯度下降(SGD)已被证明在许多深度学习应用中具有良好泛化能力。在实践中,人们常以几何衰减步长运行 SGD,即恒定初始步长后接多次几何步长衰减,并使用末次迭代作为输出。这类 SGD 已知对经典有限维线性回归问题近乎极小极大最优(Ge et al., 2019)。然而,针对过参数化设定下 SGD 末次迭代的尖锐分析仍是开放问题。本文中,我们针对(过参数化)线性回归问题,给出了具有衰减步长的 SGD 末次迭代风险界的问题相关分析。特别地,对于具有(尾部)几何衰减步长的末次迭代 SGD,我们证明了关于超额风险的近乎匹配的上界与下界。此外,我们给出了具有多项式衰减步长的末次迭代 SGD 的超额风险下界,并以实例方式展示了几何衰减步长的优势,这补充了先前工作所做的极小极大速率比较。

关键词

引用

@article{arxiv.2110.06198,
  title  = {Last Iterate Risk Bounds of SGD with Decaying Stepsize for Overparameterized Linear Regression},
  author = {Jingfeng Wu and Difan Zou and Vladimir Braverman and Quanquan Gu and Sham M. Kakade},
  journal= {arXiv preprint arXiv:2110.06198},
  year   = {2022}
}

备注

35 pages, 2 figures, 1 table. In ICML 2022