中文

低通滤波 SGD:在深度学习优化景观中恢复平坦最优点

机器学习 2022-02-07 v2

摘要

本文中,我们研究深度学习(DL)损失景观在局部极小值附近的锐度,以揭示 DL 模型泛化能力背后的系统性机制。我们的分析跨越不同的网络与优化器超参数,并涉及丰富族类的不同锐度度量。我们比较这些度量,表明基于低通滤波的度量与 DL 模型泛化能力的相关性最高,对数据与标签噪声均具有高鲁棒性,且能追踪神经网络的双下降行为。接下来我们推导了依赖低通滤波(LPF)的优化算法,该算法使用类 SGD 过程主动搜索 DL 优化景观中的平坦区域。我们所提算法(称为 LPF-SGD)的更新由滤波器核与损失函数卷积的梯度决定,并可利用 MC 采样高效计算。我们从经验上表明,相较常见 DL 训练策略,我们的算法取得了更优的泛化性能。在理论方面,我们证明 LPF-SGD 收敛到比 SGD 泛化误差更小的更优最优点。

关键词

引用

@article{arxiv.2201.08025,
  title  = {Low-Pass Filtering SGD for Recovering Flat Optima in the Deep Learning Optimization Landscape},
  author = {Devansh Bisla and Jing Wang and Anna Choromanska},
  journal= {arXiv preprint arXiv:2201.08025},
  year   = {2022}
}