中文

German Commons——用于德语语言模型的1540亿开放许可文本Token

计算与语言 2025-10-17 v1

摘要

大型语言模型的开发依赖于大规模训练语料库,然而大多数语料库包含许可状态不明确的数据,限制了真正开放模型的开发。对于非英语语言,这一问题更为严重,因为开放许可文本仍然极度稀缺。我们推出了German Commons,这是迄今为止最大的开放许可德语文本集合。它汇集了来自七个领域(涵盖法律、科学、文化、政治、新闻、经济和网络文本)的41个来源的数据。通过从具有可验证许可的既定数据提供商处系统性地获取数据,我们获得了1545.6亿个高质量文本Token,用于语言模型训练。我们的处理流程实现了全面的质量过滤、去重和文本格式修正,确保了异构文本源之间的一致质量。所有领域子集均采用至少CC-BY-SA 4.0或同等许可,确保了模型训练和再分发的法律合规性。因此,German Commons填补了开放许可德语预训练数据的关键空白,并使得开发真正开放的德语语言模型成为可能。我们还发布了针对德语文本的语料库构建和数据过滤代码,使German Commons完全可复现和可扩展。

关键词

引用

@article{arxiv.2510.13996,
  title  = {The German Commons - 154 Billion Tokens of Openly Licensed Text for German Language Models},
  author = {Lukas Gienapp and Christopher Schröder and Stefan Schweter and Christopher Akiki and Ferdinand Schlatt and Arden Zimmermann and Phillipe Genêt and Martin Potthast},
  journal= {arXiv preprint arXiv:2510.13996},
  year   = {2025}
}

备注

13 pages, 3 figures, 12 tables, includes datasheet