中文

与 SGD 同行

机器学习 2018-05-31 v4 机器学习

摘要

我们提出了关于随机梯度下降 (SGD) 如何 navigates 过参数化深度神经网络 (DNNs) 损失景观的新颖实证观察。这些观察揭示了学习率与批大小在 DNN 优化与泛化中性质不同的作用。具体地,我们通过插值连续迭代间参数的损失面并在训练中追踪多种指标,来研究沿 SGD 轨迹的 DNN 损失曲面。我们发现,在大部分训练中,每次训练迭代更新前后参数之间的损失插值在两者之间具有一个近似凸的最小值(谷底)。基于此及其他指标,我们推断在大部分训练更新步中,SGD 通过在损失面类谷区域中从一侧谷壁跳到另一侧谷壁、且位于谷底之上一定高度处移动。这种 '在某一高度于谷壁间弹跳' 的机制帮助 SGD 在小批大小与大学习率下遍历更大距离,我们发现二者在动力学中扮演性质不同的角色。大学习率维持距谷底的大高度,而小批大小注入噪声促进探索。我们发现该机制对泛化至关重要,因为谷底存在势垒,而谷底之上的探索使 SGD 能够快速远离初始化点(不受势垒影响)并找到更平坦区域,对应更好的泛化。

关键词

引用

@article{arxiv.1802.08770,
  title  = {A Walk with SGD},
  author = {Chen Xing and Devansh Arpit and Christos Tsirigotis and Yoshua Bengio},
  journal= {arXiv preprint arXiv:1802.08770},
  year   = {2018}
}

备注

First two authors contributed equally