中文

数据规模增长作为预测贡献谱的渐进覆盖

计算与语言 2026-05-21 v1 人工智能 机器学习

摘要

我们探究了这样一个假设:真实数据的缩放定律是由对潜在预测贡献谱的渐进覆盖所支配,而非仅仅由词元频率的尾部决定。我们使用文本语料库的后缀自动机表示,并定义了一个数据内在的全局KL预测贡献谱,其中每个状态根据其经验质量乘以它与全局下一个词元基线的KL偏差来贡献。在12个真实语料库中,该谱的尾部斜率已经与一个固定小型GPT学习器的经验数据缩放指数强相关。然后,我们超越斜率相关性,通过将观察到的超额损失与准备好的1000k全局KL谱的残余尾部质量相匹配,为每个训练规模N定义了一个有效截断秩K(N)。经验上,log K与log N接近线性关系,原始谱的汇总R^2约为0.96,平滑谱的R^2约为0.90。这些发现为一个简单的机制图景提供了强有力的经验支持:训练规模推动一个有效前沿穿过预测状态谱,而该谱的残余尾部质量追踪着剩余的超额损失。

关键词

引用

@article{arxiv.2605.20196,
  title  = {Data Scaling as Progressive Coverage of a Predictive Contribution Spectrum},
  author = {Zihui Song and Shihao Ji and Hongxi Li and Shuaizhi Cheng and Chunlin Huang},
  journal= {arXiv preprint arXiv:2605.20196},
  year   = {2026}
}

备注

8 pages,6 figures