中文

深度 Grokking:深层神经网络的泛化能力如何?

机器学习 2024-05-31 v1 机器学习

摘要

最近的研究阐明了神经网络训练动力学及其泛化行为的复杂性。Grokking 指的是网络在训练集完全拟合后,长期过拟合阶段之后,测试集泛化准确率的尖锐上升。虽然现有研究主要关注浅层网络,如 2 层 MLP 和 1 层 Transformer,但我们探索了在深层网络(如 12 层 MLP)上的 Grokking 现象。我们经验性地复制了该现象,发现深层神经网络比其浅层对应物更易受 Grokking 影响。同时,我们观察到在增加 MLP 模型深度时,出现一种令人惊讶的多阶段泛化现象,其中测试准确率呈现第二次激增,这在浅层模型中很少见。我们进一步发现,特征秩的减少与从过拟合阶段到泛化阶段的相位转换之间存在有说服力的对应关系。此外,我们发现,多阶段泛化现象常常与特征秩中的双下降模式相吻合。这些观察表明,内部特征秩可能是比权重范数更具指示性的模型泛化行为指标。我们认为本工作是首次深入探讨深层神经网络中的 Grokking,以及特征秩与泛化性能之间的关系。

关键词

引用

@article{arxiv.2405.19454,
  title  = {Deep Grokking: Would Deep Neural Networks Generalize Better?},
  author = {Simin Fan and Razvan Pascanu and Martin Jaggi},
  journal= {arXiv preprint arXiv:2405.19454},
  year   = {2024}
}