中文

距离越远性能越差:从层利用与模型泛化视角出发

机器学习 2022-01-31 v1

摘要

深度神经网络的泛化能力仍是机器学习中的主要开放问题之一。以往的理论工作侧重于推导模型复杂度的紧界,而实证研究表明神经网络在训练样本量和网络规模上均呈现双下降现象。本文通过实证考察了神经网络不同层对模型贡献的差异;我们发现浅层通常学习对训练数据与测试数据性能均相关的表示。相反,深层仅最小化训练风险,无法在测试数据或错误标注数据上良好泛化。我们进一步说明,最终层训练权重与其初始值的距离与泛化误差高度相关,并可作为模型过拟合的指示量。此外,我们给出证据支持通过重新初始化最终层权重进行训练后正则化。我们的发现提供了一种估计神经网络泛化能力的有效方法,这些定量结果的洞见或有助于推导考虑神经网络内部结构的更优泛化界。

关键词

引用

@article{arxiv.2201.11939,
  title  = {With Greater Distance Comes Worse Performance: On the Perspective of Layer Utilization and Model Generalization},
  author = {James Wang and Cheng-Lin Yang},
  journal= {arXiv preprint arXiv:2201.11939},
  year   = {2022}
}