中文

从感知器到深度网络:隐式偏差产生神经网络学习曲线中的神经网络比例定律

机器学习 2026-05-01 v3 无序系统与神经网络 机器学习

摘要

深度学习中的比例定律——将模型性能与资源增长联系起来的经验幂律关系——在各种架构、数据集和任务之间已成为简单而惊人的常规性。这些定律在指导 state-of-the-art 模型设计方面尤为重要,因为它们量化了增加数据或模型规模的好处,并暗示了机器学习可解释性的基础。然而,大多数研究只关注训练结束时的渐近行为。在本工作中,我们通过分析整个训练动力学来描述更丰富的图景:我们识别出两种新的动态比例定律,解释了性能如何作为不同范数基复杂度措施的函数而演化。结合,我们的新定律恢复了在收敛时测试误差的众所周知的比例。我们的发现在在 MNIST、CIFAR-10 和 CIFAR-100 上训练的 CNN、ResNet 和 Vision Transformer 之间保持一致。此外,我们提供了在使用 logistic loss 的单层感知器上进行的分析,在该模型上我们推导了新的动态比例定律,并通过梯度-based 训练所产生的隐式偏差来解释。

关键词

引用

@article{arxiv.2505.13230,
  title  = {Implicit bias produces neural scaling laws in learning curves, from perceptrons to deep networks},
  author = {Francesco D'Amico and Dario Bocchi and Matteo Negri},
  journal= {arXiv preprint arXiv:2505.13230},
  year   = {2026}
}

备注

Final accepted version at ICLR26 main conference; 27 pages, 21 Figures, 5 tables