中文

RePro:用于预训练的语言模型回收方法

计算与语言 2025-10-15 v1 机器学习

摘要

高质量的预训练数据是大型语言模型 (LLM) 的化石燃料,但其储量对于前沿模型已趋于枯竭。本文介绍了 RePro,一种新的网页回收方法,通过强化学习训练相对较小的语言模型,以生成对预训练数据的有效且忠实的重述。具体而言,我们设计了一个质量奖励和三个忠诚度奖励,优化语言模型重述器,将有机数据转换为高质量的重述,同时保持其核心语义和结构。在实验中,我们训练了一个 4B 参数的重述器来回收 DCLM-RefinedWeb 中采样的 720 亿 token。在 400M 和 1.4B 参数模型上的预训练结果表明,RePro 在 22 个下游任务上相对于仅使用有机数据的基线实现了 4.7%~14.0% 的相对精度提升。RePro 还优于使用 70B 参数重述器的 ReWire(最新方法),以及数据池规模为 4 倍的有机基线。不同回收数据量的实验表明,RePro 将有机数据的效率提高了 2~3 倍。定性和分布分析验证了 RePro 在保留关键信息方面更可靠,忠实反映有机数据的特征,优于基于提示的方法。总体而言,这些结果表明 RePro 为高效可控地利用 LLM 预训练的化石燃料提供了可行方案。我们已开源代码、重述器及回收数据至 https://github.com/cxcscmu/RePro。

关键词

引用

@article{arxiv.2510.10681,
  title  = {RePro: Training Language Models to Faithfully Recycle the Web for Pretraining},
  author = {Zichun Yu and Chenyan Xiong},
  journal= {arXiv preprint arXiv:2510.10681},
  year   = {2025}
}