中文

深度神经网络中泛化与记忆的几何性质研究

机器学习 2021-06-01 v1 无序系统与神经网络 机器学习

摘要

理解大型神经网络如何避免记忆训练数据,是解释其高泛化性能的关键。为考察深度网络中记忆发生的时间与位置结构,我们采用了一种近期发展的基于复本的平均场理论几何分析方法。我们发现所有层都优先从具有共享特征的样本中学习,并将此行为与泛化性能相联系。记忆主要发生于较深层,这是由于目标流形半径与维数递减,而浅层受影响极小。这预测通过将在显著记忆发生前的较早训练轮次的最后几层权重回退,可恢复泛化,实验证实了该预测。此外,通过研究不同模型规模下的泛化,我们揭示了双下降现象与底层模型几何之间的联系。最后,解析分析表明网络在训练早期避免记忆,是因为在初始化附近,置换样本的梯度贡献很小。这些发现为深度神经网络各层的记忆结构、其驱动因素及其与流形几何性质的联系提供了定量证据。

关键词

引用

@article{arxiv.2105.14602,
  title  = {On the geometry of generalization and memorization in deep neural networks},
  author = {Cory Stephenson and Suchismita Padhy and Abhinav Ganesh and Yue Hui and Hanlin Tang and SueYeon Chung},
  journal= {arXiv preprint arXiv:2105.14602},
  year   = {2021}
}

备注

ICLR 2021