如何合成高质量预训练数据?对提示设计、生成模型与源数据的系统研究
计算与语言
2026-04-16 v1 人工智能
机器学习
摘要
合成数据是训练大型语言模型的标准组成部分,但关于包括重述策略、生成模型和源数据等设计维度的系统性比较仍然缺失。我们进行了大量受控实验,生成超过一万亿标记,以识别将网页文本重述为合成预训练数据的关键因素。我们的结果表明,结构化输出格式(如表格、数学问题、FAQ 和教程)始终优于精选网页基线和现有合成方法。值得注意的是,超过 1B 参数的生成模型大小没有提供额外益处。我们的分析还显示,选择用于混合的原始数据对性能影响显著。通过应用我们的发现,我们开发了 \textbf{\textsc{FinePhrase}},一个包含 4860 亿标记的开放式重述网页文本数据集。我们表明 \textsc{FinePhrase} 在所有现有合成数据基线上均优于,并将生成成本降低最高可达 30 倍。我们提供数据集、所有提示和生成框架供研究社区使用。
引用
@article{arxiv.2604.13977,
title = {How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data},
author = {Joel Niklaus and Atsuki Yamaguchi and Michal Štefánik and Guilherme Penedo and Hynek Kydlíček and Elie Bakouch and Lewis Tunstall and Edward Emanuel Beeching and Thibaud Frere and Colin Raffel and Leandro von Werra and Thomas Wolf},
journal= {arXiv preprint arXiv:2604.13977},
year = {2026}
}