UberWeb:多语言策展的20万亿Token数据集洞见
机器学习
2026-02-27 v3
摘要
多语言性是现代基础模型的核心能力,但由于不同语言数据 availability 不均,训练高质量的多语言模型仍富有挑战性。进一步的挑战是来自联合多语言训练可能产生的性能干扰,通常称为“多语言诅咒”。我们研究了跨十三种语言的多语言数据策展,发现许多报告的性能下降并非源于多语言规模的根本限制,而是源于数据质量和构成的可纠正缺陷。 在受控的双语实验中,提高任何单一语言的数据质量都能惠及其他语言:提高英文数据质量可改善12中13种非英文语言的性能,而针对非英文的策展也能在 reciprocally 改善英文。针对每种语言的定制策展可显著放大单语言性能提升。将这些发现扩展到大规模通用训练混合数据,我们展示,经过策展的多语言配置即使只占总 token 数的少于8%,也依然非常有效。我们在一个生产了20T token预训练语料库的项目中实现了这一方法,该语料库完全来自公开来源。采用1T token随机子集训练的3B和8B参数模型,可实现与4-10倍更少训练 FLOPs的强大公开基线相当的多语言准确率,树立了多语言性能与计算效率的新 Pareto 前沿。此外,这些优势也适用于前沿模型规模:该20T token语料库作为Trinity Large(400B/A13B)预训练数据的一部分,其模型在训练 FLOPs相对较弱的情况下展现出强劲的多语言性能。这些结果表明,针对性的、按语言划分的数据策展可缓解多语言干扰,使多语言规模的计算效率实现了跨越式提升。
引用
@article{arxiv.2602.15210,
title = {\"UberWeb: Insights from Multilingual Curation for a 20-Trillion-Token Dataset},
author = {DatologyAI and : and Aldo Gael Carranza and Kaleigh Mentzer and Ricardo Pio Monti and Alex Fang and Alvin Deng and Amro Abbas and Anshuman Suri and Brett Larsen and Cody Blakeney and Darren Teh and David Schwab and Diego Kiner and Fan Pan and Haakon Mongstad and Haoli Yin and Jack Urbanek and Jason Lee and Jason Telanoff and Josh Wills and Luke Merrick and Maximilian Böther and Parth Doshi and Paul Burstein and Pratyush Maini and Rishabh Adiga and Siddharth Joshi and Spandan Das and Tony Jiang and Vineeth Dorna and Zhengping Wang and Bogdan Gaza and Ari Morcos and Matthew Leavitt},
journal= {arXiv preprint arXiv:2602.15210},
year = {2026}
}