源自数据流形维度的神经缩放律
机器学习
2020-04-24 v1 机器学习
摘要
当数据充足时,训练良好的神经网络所达到的损失随网络参数数量 以幂律 缩放。这一经验缩放律适用于多种数据模态,并可能持续许多数量级。如果神经模型实际上只是在内在维度为 的数据流形上执行回归,则该缩放律可得以解释。这一简单理论预测,对于交叉熵和均方误差损失,缩放指数 。我们通过在教师-学生(teacher/student)框架中独立测量内在维度和缩放指数来验证该理论,其中我们可以通过调节随机教师网络的性质来研究各种 和 。我们还在多个数据集上用CNN图像分类器以及GPT类语言模型对理论进行了测试。
引用
@article{arxiv.2004.10802,
title = {A Neural Scaling Law from the Dimension of the Data Manifold},
author = {Utkarsh Sharma and Jared Kaplan},
journal= {arXiv preprint arXiv:2004.10802},
year = {2020}
}
备注
16+12 pages, 11+11 figures