神经比例律的起源:从随机图到自然语言
机器学习
2026-01-16 v1 无序系统与神经网络
人工智能
机器学习
摘要
比例律在现代人工智能革命中发挥了主要作用,为实践者提供了对模型性能随数据、计算资源和模型参数数量增加而提升的预测能力。这推动了对神经比例律起源的强烈兴趣,普遍认为它们源于数据中已存在的幂次结构。本文我们研究在可调复杂性的图上,对随机漫步(bigram)进行预测的变换器模型的比例律。我们展示,即使在数据相关性中不存在幂次结构的情况下,这一简化设置也会产生神经比例律。我们进一步考虑系统性地降低自然语言的复杂性,通过在序列上训练,从4层、2层、1层变换器语言模型到语言bigram,不断揭示比例指数的单调演变。我们的研究结果还包括从爱德华-温里和巴拉阿西-阿尔伯特集合中抽取的随机图上的随机漫步训练得到的比例律。最后,我们重新审视语言建模的常规比例律,展示使用上下文长度为50的两层变换器即可复现多个关键结果,对先前文献中使用的各种拟合方法进行批判性分析,提出一种不同于当前出版物中做法的获取计算最优曲线的方法,并提供最大更新参数化可能比标准参数化更高效的初步证据。
引用
@article{arxiv.2601.10684,
title = {On the origin of neural scaling laws: from random graphs to natural language},
author = {Maissam Barkeshli and Alberto Alfarano and Andrey Gromov},
journal= {arXiv preprint arXiv:2601.10684},
year = {2026}
}
备注
33 pages