中文

源自数据流形维度的神经缩放律

机器学习 2020-04-24 v1 机器学习

摘要

当数据充足时,训练良好的神经网络所达到的损失随网络参数数量 NN 以幂律 LNαL \propto N^{-\alpha} 缩放。这一经验缩放律适用于多种数据模态,并可能持续许多数量级。如果神经模型实际上只是在内在维度为 dd 的数据流形上执行回归,则该缩放律可得以解释。这一简单理论预测,对于交叉熵和均方误差损失,缩放指数 α4/d\alpha \approx 4/d。我们通过在教师-学生(teacher/student)框架中独立测量内在维度和缩放指数来验证该理论,其中我们可以通过调节随机教师网络的性质来研究各种 ddα\alpha。我们还在多个数据集上用CNN图像分类器以及GPT类语言模型对理论进行了测试。

关键词

引用

@article{arxiv.2004.10802,
  title  = {A Neural Scaling Law from the Dimension of the Data Manifold},
  author = {Utkarsh Sharma and Jared Kaplan},
  journal= {arXiv preprint arXiv:2004.10802},
  year   = {2020}
}

备注

16+12 pages, 11+11 figures