理解深度学习泛化能力之路:损失景观的视角
机器学习
2017-11-29 v2 人工智能
机器学习
摘要
广泛观察到,具有学习参数的深度学习模型泛化良好,即使模型参数远多于训练样本数。我们系统研究了深度神经网络经常泛化良好的潜在原因,并揭示了泛化良好的极小值(具有相同训练误差)与泛化不佳的极小值之间的差异。我们表明,正是损失函数景观的特征解释了良好的泛化能力。对于深度网络的损失函数景观,良好极小值的吸引域体积主导了不良极小值的吸引域体积,这保证了随机初始化的优化方法收敛到良好极小值。我们通过分析2层神经网络从理论上证明了我们的发现;并表明低复杂度解关于模型参数的海森矩阵范数较小。对于更深网络,大量数值证据有助于支持我们的论点。
引用
@article{arxiv.1706.10239,
title = {Towards Understanding Generalization of Deep Learning: Perspective of Loss Landscapes},
author = {Lei Wu and Zhanxing Zhu and Weinan E},
journal= {arXiv preprint arXiv:1706.10239},
year = {2017}
}