中文

大学习率随机梯度下降的良性振荡

机器学习 2023-10-27 v1 最优化与控制 机器学习

摘要

在这项工作中,我们从理论上研究了由大学习率随机梯度下降(SGD)算法训练的神经网络(NN)的泛化性质。在此训练机制下,我们的发现是:大学习率 SGD 训练引起的 NN 权重振荡反而有利于 NN 的泛化,可能优于以更平滑方式收敛的小学习率 SGD 所训练的相同 NN。鉴于这一发现,我们称此种现象为“良性振荡”。我们揭示该现象的理论建立在深度学习的特征学习视角之上。具体而言,我们考虑一个特征-噪声数据生成模型,该模型包含:(i) 弱特征,其具有较小的 2\ell_2 范数且出现在每个数据点中;(ii) 强特征,其具有较大的 2\ell_2 范数但仅出现在所有数据点的某个比例中;以及 (iii) 噪声。我们证明,由大学习率振荡 SGD 训练的 NN 能够在存在这些强特征的情况下有效学习弱特征。相比之下,小学习率 SGD 训练的 NN 只能学习强特征,而在学习弱特征方面进展甚微。因此,当面对仅由弱特征组成的新测试数据时,大学习率振荡 SGD 训练的 NN 仍能持续做出正确预测,而小学习率 SGD 训练的 NN 则失败。我们的理论阐明了大学习率训练如何有益于 NN 的泛化。实验结果展示了我们关于“良性振荡”的发现。

关键词

引用

@article{arxiv.2310.17074,
  title  = {Benign Oscillation of Stochastic Gradient Descent with Large Learning Rates},
  author = {Miao Lu and Beining Wu and Xiaodong Yang and Difan Zou},
  journal= {arXiv preprint arXiv:2310.17074},
  year   = {2023}
}

备注

63 pages, 10 figures