中文

解构 LLM 预训练中的合成数据:规模定律、优势与陷阱的系统性研究

机器学习 2025-10-03 v1 人工智能 计算与语言

摘要

训练数据在大型语言模型(LLM)规模化方面发挥着关键作用,但高质量数据供应有限。合成数据技术提供了一条规避这些限制的潜在路径。我们进行了一次大规模实证调查(超过1000个LLM,累计超过10万个GPU小时),采用统一的协议和规模定律,对比自然网页数据、多样化的合成类型(改写文本、生成教科书)以及自然与合成数据混合物。具体而言,我们发现仅使用改写合成数据进行预训练的速度,不如仅使用自然网页文本;但在数据预算更大时,将1/3比例的改写合成数据与2/3比例的自然网页数据混合预训练,可实现5-10倍的加速(以相同验证损失为衡量标准)。仅使用教科书式合成数据进行预训练会导致在许多下游领域尤其在小数据预算下方程显著更高。"好"的合成数据比例取决于模型规模和数据预算,经验上收敛于约30%的改写合成数据。更大的生成模型并不一定能产生优于约80亿参数模型的预训练数据。这些结果对"模型崩溃"在大规模单轮(n=1)仅使用合成数据训练提供了混合证据——改写合成数据的预训练在可预见的规模下未显示出性能下降,而教科书式纯生成合成数据的混合训练则呈现出"模型崩溃"预测模式。我们的工作解构了预训练中的合成数据,验证了其条件性优势,并提供了实用指导。

关键词

引用

@article{arxiv.2510.01631,
  title  = {Demystifying Synthetic Data in LLM Pre-training: A Systematic Study of Scaling Laws, Benefits, and Pitfalls},
  author = {Feiyang Kang and Newsha Ardalani and Michael Kuchnik and Youssef Emad and Mostafa Elhoushi and Shubhabrata Sengupta and Shang-Wen Li and Ramya Raghavendra and Ruoxi Jia and Carole-Jean Wu},
  journal= {arXiv preprint arXiv:2510.01631},
  year   = {2025}
}

备注

Published as a Main Conference paper at EMNLP 2025