基于统计与逼近理论理解Transformer神经网络在固有低维数据上的缩放定律
机器学习
2024-11-12 v1 人工智能
计算与语言
机器学习
摘要
训练深度神经网络时,模型的泛化误差通常表现出依赖于模型规模和数据集规模的幂律缩放。Transformer-based大语言模型是此类缩放定律最著名的例子,其中数十亿参数的网络在数万亿token文本上进行训练。然而,尽管持续受到广泛关注,对Transformer缩放定律为何存在的严格理解仍然缺失。为了回答这一问题,我们为Transformer在输入数据集中于低维流形时建立了新颖的统计估计与数学逼近理论。我们的理论预测了Transformer泛化误差与训练数据规模和网络规模之间的幂律关系,其中幂指数取决于训练数据的固有维度d。值得注意的是,所构建的模型架构是浅层的,仅需关于d的对数深度。通过利用流形假设下的低维数据结构,我们能够在尊重数据几何的方式下解释Transformer缩放定律。此外,我们通过在自然语言数据集上训练大语言模型来检验理论。我们发现观测到的经验数据缩放定律与理论预测高度吻合。综合来看,这些结果严格地证明了数据固有维度是影响Transformer缩放定律在理论和实践中的关键量。
引用
@article{arxiv.2411.06646,
title = {Understanding Scaling Laws with Statistical and Approximation Theory for Transformer Neural Networks on Intrinsically Low-dimensional Data},
author = {Alex Havrilla and Wenjing Liao},
journal= {arXiv preprint arXiv:2411.06646},
year = {2024}
}