中文

揭示神经网络中宽平坦极小值的构造

无序系统与神经网络 2022-02-15 v5 机器学习 数学物理 math.MP 概率论

摘要

深度学习的成功揭示了神经网络在各科学领域的应用潜力,并开启了基础理论问题。特别是,基于梯度方法简单变体的学习算法能够找到高度非凸损失函数的近最优极小值,这是神经网络的一个意外特征。此外,即便存在噪声,此类算法也能拟合数据,却仍具备优异的预测能力。若干经验结果显示,算法所达极小值的所谓平坦度与泛化性能之间存在可复现的相关性。与此同时,统计物理结果表明,在非凸网络中,大量窄极小值可能与数量少得多的、泛化良好的宽平坦极小值共存。在此我们表明,宽平坦极小值作为复杂的广延结构出现,源于围绕“高间隔”(即局部鲁棒)构型的极小值合并。尽管与零间隔极小值相比呈指数稀有,高间隔极小值倾向于聚集在特定区域。这些极小值进而被间隔越来越小的其他解所包围,导致在长距离上形成稠密的解区域。我们的分析还提供了一种替代性解析方法,用于估计随着模型参数数量变化,平坦极小值何时出现以及算法何时开始找到解。

关键词

引用

@article{arxiv.2107.01163,
  title  = {Unveiling the structure of wide flat minima in neural networks},
  author = {Carlo Baldassi and Clarissa Lauditi and Enrico M. Malatesta and Gabriele Perugini and Riccardo Zecchina},
  journal= {arXiv preprint arXiv:2107.01163},
  year   = {2022}
}

备注

15 pages, 8 figures