中文

重新审视比例定律:数据质量在语言模型预训练中的作用建模

机器学习 2026-02-24 v2

摘要

语言模型训练的比例定律传统上描述了性能如何随模型规模和数据集容量而变化。先前的研究探索了架构变体和数据处理方法,如语言模型预训练中的数据集过滤和噪声注入;然而,这些研究没有在原则性比例定律中形式化数据质量。我们提出无量纲数据质量参数Q,提出扩展Chinchilla框架的质量感知比例定律,用于预测模型规模、数据容量和数据质量共同作用下的损失。该定律源于对噪声或冗余语料库的有效样本量和信息论视角,容纳两种实际估算器:(i)损坏率代理,和(ii)缺失度量。通过在神经机器翻译和自回归建模中的合成实验——我们通过多种噪声注入变体系统性控制数据质量——我们展示损失随数据质量可预测地变化,更高质量的数据可显著减少模型规模,从而降低计算需求。我们的结果表明,有效数据的衰减呈亚线性,对于中度数据损坏具有鲁棒性;超出样本评估进一步验证了该定律的预测形式。与以往的经验性分析不同,我们的工作确立了一个明确、可推广的数据质量定律,为在大规模预训练中平衡数据精选工作量和模型规模提供了具体指导。

关键词

引用

@article{arxiv.2510.03313,
  title  = {Scaling Laws Revisited: Modeling the Role of Data Quality in Language Model Pretraining},
  author = {Anirudh Subramanyam and Yuxin Chen and Robert L. Grossman},
  journal= {arXiv preprint arXiv:2510.03313},
  year   = {2026}
}

备注

21 pages, 5 figures