中文

大语言模型信息标度定律:质量加权混合数据与重复

计算与语言 2026-05-05 v1

摘要

提高 LLM 预训练中高质量数据的权重常能提升性能,但在数据受限的情境下,尤其在过度训练情况下,更强的加权会增加重复并可能降低性能。然而,标准标度定律在不同混合配方或重复情况下难以可靠外推,使得在规模化训练中选择最优数据配方变得难以判断。为解决此问题,我们提出 InfoLaw(Information Scaling Laws),一种数据感知的标度框架,用于预测由消耗的 token 数、模型规模、数据混合权重和重复次数决定的损失。核心思想是将预训练建模为信息累积,其中质量控制信息密度,重复导致尺度相关的递减报酬。我们首先收集在规模、质量分布和重复水平各异的 dataset 上的模型性能数据。随后我们构建信息模型,使得信息准确预测这些模型性能。InfoLaw 在未知数据配方和更大规模运行(最高达 7B 参数、425B token)上预测性能,平均绝对误差为 0.15%,最大绝对误差为 0.96%,并可靠外推至不同的过度训练水平,从而在不同计算预算下实现数据配方的高效选择。

关键词

引用

@article{arxiv.2605.02364,
  title  = {InfoLaw: Information Scaling Laws for Large Language Models with Quality-Weighted Mixture Data and Repetition},
  author = {Fengze Liu and Weidong Zhou and Binbin Liu and Ping Guo and Zijun Wang and Bingni Zhang and Yifan Zhang and Yifeng Yu and Xiaohuan Zhou and Taifeng Wang},
  journal= {arXiv preprint arXiv:2605.02364},
  year   = {2026}
}

备注

ICML 2026