Aleph-Alpha-GermanWeb: 基于模型数据清洗和合成数据生成改进德语语言大模型预训练
计算与语言
2026-04-01 v3 人工智能
机器学习
摘要
扩大数据数量是大型语言模型(LLMs)的关键,但近期研究表明数据质量对性能和训练效率具有显著提升作用。我们介绍了一个德语语言数据清洗管道,结合启发式方法和模型基准过滤技术,以及合成数据生成。我们利用该管道创建 Aleph-Alpha-GermanWeb,这是一个由三部分组成的 6280 亿词德语预训练数据集:(1)Common Crawl 网页数据(有机子集;780 亿词),(2)FineWeb2(有机子集;2350 亿词),(3)以实际有机网页数据为条件生成的合成数据子集(3290 亿词)。我们通过对预训练的 10 亿参数 Llama 风格模型和 80 亿词无词表层次自回归变换器(HAT)进行预训练来评估该数据集。在德语语言基准测试(包括 MMMLU)上的比较显示,Aleph-Alpha-GermanWeb 相对于 FineWeb2 单独使用取得显著性能提升。即使在 FineWeb2 丰富了由人工精选高质量数据源(如维基百科)时,80 亿规模下的优势依然存在。我们的发现支持日益增长的证据,即模型基准数据清洗和合成数据生成可显著提升大模型预训练数据集。
引用
@article{arxiv.2505.00022,
title = {Aleph-Alpha-GermanWeb: Improving German-language LLM pre-training with model-based data curation and synthetic data generation},
author = {Thomas F Burns and Letitia Parcalabescu and Stephan Wäldchen and Michael Barlow and Gregor Ziegltrum and Volker Stampa and Bastian Harren and Björn Deiseroth},
journal= {arXiv preprint arXiv:2505.00022},
year = {2026}
}
备注
17 pages, 3 figures; published at EACL 2026