中文

统一的神经网络缩放定律与规模-时间等价性

机器学习 2024-09-10 v1 机器学习

摘要

随着神经网络规模持续增长而数据集可能无法同步增长,理解性能提升的预期程度至关重要:扩大网络规模与增加数据量哪个更重要?因此,刻画测试误差如何随网络规模和数据量变化的神经网络缩放定律变得日益重要。然而,现有的缩放定律通常仅适用于有限的范围,且往往未能纳入或预测诸如双重下降等众所周知的现象。本文中,我们对模型规模、训练时间和数据量这三个因素如何相互作用以决定深度神经网络性能进行了新颖的理论刻画。我们首先在理论和实验上建立了缩放神经网络规模与按比例增加其训练时间之间的等价性。规模-时间等价性挑战了当前对大模型进行短时间训练的做法,并表明在更长时间内训练的小模型可以达到与之相当的效果。这也催生了一种新方法,可以从长时间训练的小规模网络预测大规模网络的性能,反之亦然。接着,我们将规模-时间等价性与双重下降的线性模型分析相结合,得到了一个统一的理论缩放定律,并通过视觉基准和网络架构的实验进行了验证。这些定律解释了若干先前未解的现象:更大模型泛化所需的数据量减少、过参数化模型对标签噪声的敏感性增高,以及增加模型规模未必能提升性能的实例。我们的发现对神经网络的实际部署具有重要意义,为训练和微调大模型提供了一条更易获取且高效的路径。

关键词

引用

@article{arxiv.2409.05782,
  title  = {Unified Neural Network Scaling Laws and Scale-time Equivalence},
  author = {Akhilan Boopathy and Ila Fiete},
  journal= {arXiv preprint arXiv:2409.05782},
  year   = {2024}
}