计算最优神经缩放律的信息论分析
机器学习
2023-10-20 v2
摘要
我们研究大型神经网络在模型规模与训练数据集规模之间的计算最优权衡。我们的结果表明一种类似于chinchilla经验分析所支持的线性关系。尽管该工作研究了在MassiveText语料gopher上训练的基于Transformer的大型语言模型,作为发展数学理论的起点,我们聚焦于更简单的学习模型与数据生成过程,二者均基于具有sigmoid输出单元和单层ReLU激活单元隐藏层的神经网络。我们为一类增量更新统计量(例如梯度下降)的算法引入通用误差上界。对于一个受barron 1993启发的特定学习模型,我们建立了作为模型与数据集规模函数的最小信息论可达期望误差的上界。随后我们推导出使该上界最小的计算分配。我们给出的经验结果表明,该近似正确地识别了渐近线性计算最优缩放。该近似还产生了新的见解。其中一点表明,随着输入维度或潜空间复杂度的增长(例如若更长历史的词元被作为语言模型输入),应将更大比例的计算预算分配给扩大学习模型而非训练数据。
引用
@article{arxiv.2212.01365,
title = {An Information-Theoretic Analysis of Compute-Optimal Neural Scaling Laws},
author = {Hong Jun Jeon and Benjamin Van Roy},
journal= {arXiv preprint arXiv:2212.01365},
year = {2023}
}