用于数据受限规模训练的有机数据的预训练 token 生成
计算与语言
2026-05-19 v1 人工智能
机器学习
摘要
LLM 预训练正从 compute-bound 向 data-bound 范式转变,在后者中,可用的 human (organic) 文本远不足以满足规模需求。然而,达到 data-bound 范式并不意味着模型已充分利用其有机语料库。在本文中,我们引入 SynPro,一个帮助 LLM 更充分地从有限有机数据中学习的合成数据生成框架。SynPro 应用两种操作:rephrasing 和 reformat,这些操作以多样化形式呈现相同的有机来源,以促进深入学习,同时不引入外部信息。两个生成器通过 quality、faithfulness 和 data influence rewards 进行强化学习优化,并在预训练平台期不断更新,以针对模型尚未吸收的目标内容。我们使用 10% 的 Chinchilla 最优 token (0.8B 和 2.2B) 对 400M 和 1.1B 模型进行预训练,反映前沿预训练中真实的数据受限范式。我们的结果揭示,有机数据通过标准重复方式被严重低估利用:SynPro 实现了重复的 3.7-5.2 倍有效 token,即使在 1.1B 规模下也超过了在等效唯一数据上的 non-data-bound oracle。分析确认,忠实、model-aware 的合成在不导致分布坍塌的情况下维持了数据受限规模。我们开源了代码。
引用
@article{arxiv.2605.17849,
title = {Generating Pretraining Tokens from Organic Data for Data-Bound Scaling},
author = {Zichun Yu and Chenyan Xiong},
journal= {arXiv preprint arXiv:2605.17849},
year = {2026}
}