中文

BeyondWeb:从扩大合成数据规模谈起的经验教训

机器学习 2025-08-21 v2 计算与语言

摘要

最近的大型语言模型(LLM)预训练进展表明,仅仅扩大数据量最终会导致报酬递减,触及数据墙。为此,人们引进合成数据进行预训练,作为超越数据墙的前沿方法。尽管如此,影响合成数据质量的因素仍鲜为人知。本文介绍了 BeyondWeb,这是一个产生高质量合成预训练数据的框架。BeyondWeb 显著扩展了传统 web 规模数据集的能力,相较于最先进的合成预训练数据集如 Cosmopedia 和 Nemotron-CC 的高质量合成子集(Nemotron-Synth),在 14 项基准评估中平均提升最高可达 5.1 个百分点(pp)和 2.6pp。其训练速度较开放网页数据快最高可达 7.7 倍,较 Nemotron-Synth 快 2.7 倍。惊人的是,在 BeyondWeb 上训练 1800 亿 token 的 3B 模型,其性能可超过在 Cosmopedia 上以相同 token 预算训练的 8B 模型。我们还从 BeyondWeb 对合成预训练数据的若干见解中呈现:其带来效益的原因、应如何选择数据进行重述,以及模型规模和系列对数据质量的影响。总体而言,本工作表明,没有任何“银弹”可以生成高质量的合成预训练数据。要获得最佳效果,需联合优化众多因素,这是一项需要严谨科学与实际专业知识的挑战性任务。朴素的方法可能仅能实现有限的改进,甚至代价巨大,而经过精心执行的方法则可实现变革性的提升,如 BeyondWeb 所示。

关键词

引用

@article{arxiv.2508.10975,
  title  = {BeyondWeb: Lessons from Scaling Synthetic Data for Trillion-scale Pretraining},
  author = {DatologyAI and : and Pratyush Maini and Vineeth Dorna and Parth Doshi and Aldo Carranza and Fan Pan and Jack Urbanek and Paul Burstein and Alex Fang and Alvin Deng and Amro Abbas and Brett Larsen and Cody Blakeney and Charvi Bannur and Christina Baek and Darren Teh and David Schwab and Haakon Mongstad and Haoli Yin and Josh Wills and Kaleigh Mentzer and Luke Merrick and Ricardo Monti and Rishabh Adiga and Siddharth Joshi and Spandan Das and Zhengping Wang and Bogdan Gaza and Ari Morcos and Matthew Leavitt},
  journal= {arXiv preprint arXiv:2508.10975},
  year   = {2025}
}

备注

Blog version can be viewed at: http://blog.datologyai.com/beyondweb