Common Corpus: 用于 LLM 预训练的最大规模合乎伦理的数据集合
计算与语言
2026-05-20 v3
摘要
大型语言模型(LLMs)在不同来源和领域的大量数据上进行预训练。此类数据集通常包含数万亿个token,包括大量受版权保护或专有的内容,这引发了关于此类模型合法使用的问题。这凸显了对符合数据安全法规的真正开放的预训练数据的需求。在本文中,我们介绍了Common Corpus,这是用于LLM预训练的最大开放数据集。Common Corpus中汇编的数据要么不受版权保护,要么在开放许可下,总计约两万亿个token。该数据集包含多种语言,从高资源欧洲语言到预训练数据集中极少代表的某些低资源语言。此外,它还包含大量代码数据。数据来源在涵盖领域和时间跨度上的多样性,为跨不同知识领域的研究和创业需求开辟了道路。在本文中,我们介绍了数据汇编的详细出处以及数据集过滤和管理的细节。我们在Common Corpus上训练了两个小型语言模型,发现它们的性能与同等规模的其他模型相当,表明我们的数据集适用于多语言预训练。Common Corpus是对大型语言模型开放科学研究生态系统的一项关键贡献。
引用
@article{arxiv.2506.01732,
title = {Common Corpus: The Largest Collection of Ethical Data for LLM Pre-Training},
author = {Pierre-Carl Langlais and Pavel Chizhov and Catherine Arnett and Carlos Rosas Hinostroza and Mattia Nee and Eliot Krzystof Jones and Irène Girard and David Mach and Anastasia Stasenko and Ivan P. Yamshchikov},
journal= {arXiv preprint arXiv:2506.01732},
year = {2026}
}