中文

基于在线抛物线模型步长估计的SGD动量优化器

机器学习 2019-12-10 v3 机器学习

摘要

在随机梯度下降中,尤其是神经网络训练,当前主导的是一阶方法:不建模到极小值的局部距离。最优步长所需的这一信息由二阶方法提供,但它们存在诸多困难,首先全Hessian的维度数量平方即系数个数平方。本文提出从成功的动量一阶方法迈向二阶的最小一步:仅在单一方向上进行在线抛物线建模——即动量法中的归一化v^\hat{v}。做法为估计梯度g=F(θ)\vec{g}=\nabla F(\vec{\theta})v^\hat{v}方向上的线性趋势:使得对于θ=θv^\theta = \vec{\theta}\cdot \hat{v}g=gv^g= \vec{g}\cdot \hat{v}θ=θθv^\vec{\theta}_\bot=\vec{\theta}-\theta\hat{v},有g(θ+θv^)λ(θp)g(\vec{\theta}_\bot+\theta\hat{v})\approx \lambda (\theta -p)。利用线性回归,通过仅在所考虑方向上更新四个平均值(关于ggθ\thetagθg\thetaθ2\theta^2)以MSE估计λ\lambdapp。指数移动平均在此可实现廉价的在线估计,削弱旧梯度的贡献。通过控制曲率λ\lambda的符号,我们可与标准牛顿法的吸引相反而从鞍点排斥。在其余未纳入二阶模型的方向上,可同时执行例如梯度下降。文中还讨论其学习率近似μ=σθ/σg\mu=\sigma_\theta / \sigma_g,可例如实现自适应SGD——对每个参数单独优化(二阶)学习率。

关键词

引用

@article{arxiv.1907.07063,
  title  = {SGD momentum optimizer with step estimation by online parabola model},
  author = {Jarek Duda},
  journal= {arXiv preprint arXiv:1907.07063},
  year   = {2019}
}

备注

7 pages, 2 figures