中文

合成数据对语言模型的比例规律

计算与语言 2025-10-07 v3 人工智能

摘要

大型语言模型 (LLM) 在 diverse 任务中实现了强大的性能,主要由 pre-training 中使用的高质量 web 数据驱动。然而,近期研究表明,这种数据源正快速枯竭。合成数据正在成为一个有前景的替代方案,但仍不清楚合成数据集是否具有可预测的比例规律。本文通过引入 SynthLLM,一个可扩展的框架,将 pre-training 语料库转换为多样化、高质量的合成数据集来系统性地调查合成数据的比例规律。我们的方法通过自动从多个文档中提取并重新组合高层概念来实现这一点,使用图算法。来自我们对 SynthLLM 进行的大量数学实验的关键发现包括:(1) SynthLLM 生成的合成数据可靠地遵循修正后的比例规律,适用于各种模型规模;(2) 性能改进在 300B token 处趋于平台期;(3) 更大的模型需要更少的训练 token 即可接近最佳性能。例如,8B 模型在 1T token 时达到峰值,而 3B 模型需要 4T。此外,与现有的合成数据生成和数据增强方法进行比较,SynthLLM 在性能和比例规律方面均表现出色。我们的发现表明,合成数据是一种可扩展且可靠的原始 pre-training 语料库的替代方案,为模型性能的持续改进提供了可行的路径。

关键词

引用

@article{arxiv.2503.19551,
  title  = {Scaling Laws of Synthetic Data for Language Models},
  author = {Zeyu Qin and Qingxiu Dong and Xingxing Zhang and Li Dong and Xiaolong Huang and Ziyi Yang and Mahmoud Khademi and Dongdong Zhang and Hany Hassan Awadalla and Yi R. Fung and Weizhu Chen and Minhao Cheng and Furu Wei},
  journal= {arXiv preprint arXiv:2503.19551},
  year   = {2025}
}

备注

COLM 2025