中文

面向理解动量如何改善深度学习泛化能力的研究

机器学习 2022-07-14 v1 机器学习

摘要

带动量的随机梯度下降(SGD)被广泛用于训练现代深度学习架构。尽管在多种设定下使用动量可带来更快的收敛速度已被充分理解,但亦观察到动量能带来更高的泛化能力。先前工作认为动量在训练过程中稳定了SGD噪声,从而导致更高的泛化。本文采用另一视角,首先通过实证表明在某些深度学习问题中,带动量的梯度下降(GD+M)相比梯度下降(GD)显著改善了泛化。基于该观察,我们形式化地研究动量如何改善泛化。我们设计了一个二分类设定,其中使用GD+M训练的单隐藏层(过参数化)卷积神经网络在相似初始化下,可证明比使用GD训练的相同网络泛化更好。我们分析中的关键洞见是:在样本共享某些特征但边界(margin)不同的数据集上,动量是有益的。与记忆小边界数据的GD不同,GD+M凭借其历史梯度仍能在这些数据中学习到特征。最后,我们通过实验验证了我们的理论发现。

关键词

引用

@article{arxiv.2207.05931,
  title  = {Towards understanding how momentum improves generalization in deep learning},
  author = {Samy Jelassi and Yuanzhi Li},
  journal= {arXiv preprint arXiv:2207.05931},
  year   = {2022}
}

备注

Accepted at ICML 2022