中文

从自然语言统计中推导神经网络扩展规律

机器学习 2026-02-13 v2 人工智能 机器学习

摘要

尽管实验神经网络扩展规律在大规模机器学习中发挥了重要指导作用,但现有理论无法定量预测任何现代 LLM 在任何自然语言数据集上训练时的扩展指数。我们提供了数据受限扩展规律的第一个此类理论。我们提取了语言的两个关键统计特性,仅凭这两个特性即可预测神经网络扩展指数:(i) 成对标记随时间分离程度的衰减;(ii) 下一标记条件熵随条件上下文长度的衰减。我们进一步推导了一个以这些统计特性为基础、且无需任何自由参数或合成数据模型即可预测数据受限神经网络扩展指数的简单公式。我们的理论与从头训练 GPT-2 和 LLaMA 风格模型在 TinyStories 和 WikiText 两个质素不同基准上获得的实验测量神经网络扩展规律之间 exhibits 显著吻合。

关键词

引用

@article{arxiv.2602.07488,
  title  = {Deriving Neural Scaling Laws from the statistics of natural language},
  author = {Francesco Cagnetta and Allan Raventós and Surya Ganguli and Matthieu Wyart},
  journal= {arXiv preprint arXiv:2602.07488},
  year   = {2026}
}