中文

回收网络数据:一种提升语言模型预训练数据质量与数量的方法

计算与语言 2025-09-16 v3 人工智能 机器学习

摘要

缩放定律预测,大型语言模型的性能会随着模型规模和数据规模的增大而提升。在实践中,预训练一直依赖于大规模的网络爬取,使用了迄今为止互联网上几乎所有可公开获取的数据源。然而,这个自然数据池的增长速度并未与算力供给同步。此外,高质量文本的可用性更为有限:数据过滤流程通常会移除高达99%的初始网络爬取内容,以达到最先进的性能。为了应对预训练缩放的“数据墙”,我们的工作探索了转化和回收现有过滤流程中丢弃数据的方法。我们提出了REWIRE(REcycling the Web with guIded REwrite,即通过引导式重写回收网络数据),一种丰富低质量文档使其可用于训练的方法。这反过来使我们能够增加最终预训练集中合成数据的占比。在DCLM基准的1B、3B和7B规模上的实验表明,与仅使用过滤后的网络数据进行训练相比,将高质量原始文本与我们重写的文本混合,在22个多样化任务上分别带来了1.0、1.3和2.5个百分点的提升。在原始-合成数据混合上进行训练也比访问2倍网络数据更有效。通过进一步分析,我们证明了混合文本中约82%来自对原本会被丢弃的低质量文档的转化。REWIRE也优于相关的合成数据生成方法,包括维基百科风格改写、问答合成和知识提取。这些结果表明,回收网络文本有望成为扩展预训练数据的一种简单有效的方法。我们在 https://huggingface.co/datasets/facebook/recycling_the_web 公开提供了我们的高质量合成数据。

关键词

引用

@article{arxiv.2506.04689,
  title  = {Recycling the Web: A Method to Enhance Pre-training Data Quality and Quantity for Language Models},
  author = {Thao Nguyen and Yang Li and Olga Golovneva and Luke Zettlemoyer and Sewoong Oh and Ludwig Schmidt and Xian Li},
  journal= {arXiv preprint arXiv:2506.04689},
  year   = {2025}
}

备注

Accepted to COLM 2025