中文

基于损失曲面隐式正则化的深度网络泛化界

机器学习 2022-10-18 v3 机器学习

摘要

经典统计学习理论意味着拟合过多参数会导致过拟合与性能下降。现代深度神经网络尽管参数众多仍泛化良好,这与该结论矛盾,并构成了阐释深度学习成功之路上的一个主要未解问题。先前工作聚焦于随机梯度下降(SGD)诱导的隐式正则化,我们在此研究局部极小值附近能量景观的局部几何如何影响其具有高斯梯度噪声的 SGD 的统计性质。我们论证在合理假设下,局部几何迫使 SGD 停留在低维子空间附近,这诱导了另一种形式的隐式正则化,并给出深度神经网络泛化误差更紧的界。为推导神经网络的泛化误差界,我们首先引入局部极小值附近的停滞集概念,并施加总体风险的局部本质凸性性质。在此条件下,推导了 SGD 停留于这些停滞集的下界。若发生停滞,我们导出深度神经网络泛化误差的一个界,其涉及权重矩阵的谱范数但不涉及网络参数数量。在技术上,我们的证明基于控制 SGD 迭代中参数值的变化,以及基于局部极小值附近合适邻域熵的经验损失函数局部一致收敛。

关键词

引用

@article{arxiv.2201.04545,
  title  = {On generalization bounds for deep networks based on loss surface implicit regularization},
  author = {Masaaki Imaizumi and Johannes Schmidt-Hieber},
  journal= {arXiv preprint arXiv:2201.04545},
  year   = {2022}
}

备注

To appear in IEEE Transaction on Information Theory