中文

分数阶欠阻尼朗之万动力学:重尾梯度噪声下带动量的 SGD 重定目标

机器学习 2020-11-05 v2 机器学习

摘要

带动量的随机梯度下降(SGDm)是深度学习中最为流行的优化算法之一。尽管关于 SGDm 在凸问题上的理论已较为丰富,但在深度学习这一非凸且梯度噪声可能呈现重尾行为(如近期研究经验观测到)的语境下,理论发展则相当不足。本研究考虑 SGDm 的\emph{连续时间}变体,即欠阻尼朗之万动力学(ULD),并考察其在重尾扰动下的渐近性质。基于统计物理的近期研究,我们从理论与经验上论证此类扰动的重尾即便在步长较小时也会引入偏差,即动力学的\emph{平稳分布最优点}可能不匹配\emph{待优化代价函数的最优点}。作为补救,我们提出一种新框架,称之为\emph{分数阶} ULD(FULD),并证明 FULD 以所谓的 Gibbs 分布为目标,其最优点恰与原始代价的最优点一致。我们观察到 FULD 的欧拉离散化与\emph{自然梯度}方法和\emph{梯度裁剪}具有显著的算法相似性,为理解它们在深度学习中的作用提供了新视角。我们以合成模型与神经网络上的实验支撑我们的理论。

关键词

引用

@article{arxiv.2002.05685,
  title  = {Fractional Underdamped Langevin Dynamics: Retargeting SGD with Momentum under Heavy-Tailed Gradient Noise},
  author = {Umut Şimşekli and Lingjiong Zhu and Yee Whye Teh and Mert Gürbüzbalaban},
  journal= {arXiv preprint arXiv:2002.05685},
  year   = {2020}
}

备注

20 pages, Published at International Conference on Machine Learning 2020