GPT-NL 公开语料库:面向大语言模型预训练的宽松许可荷兰语优先数据集
计算与语言
2026-04-02 v1
摘要
我们提出了 GPT-NL Public Corpus,这是最大的宽松许可荷兰语资源语料库。GPT-NL Public Corpus 包含 21 个仅荷兰语数据集,共计 360 亿个预处理后的荷兰语 token,这些 token 未出现在任何其他大语言模型预训练语料库中。此外,该语料库还包括约 2070 亿个英语、2320 亿个代码和 480 亿个德语/丹麦语 token,这些数据来自现有数据集并经过进一步筛选以确保合规性。该语料库包含来自大型现有语料库(如 Common Corpus 和 Common Crawl)的精选数据,以及新创建的荷兰语特定数据集。大多数新创建的荷兰语数据集由与组织合作收集的内容或合成增强内容组成。所有数据的收集和评估均以促进创建合法、有用且无害的(商业)语言模型为目标。GPT-NL Public Corpus 中的所有数据均来自宽松许可的数据集,并在 CC-BY 许可下经过筛选和重新分发。该完整数据集在 Hugging Face Hub 上公开发布。
引用
@article{arxiv.2604.00920,
title = {GPT-NL Public Corpus: A Permissively Licensed, Dutch-First Dataset for LLM Pre-training},
author = {Jesse van Oort and Frank Brinkkemper and Erik de Graaf and Bram Vanroy and Saskia Lensink},
journal= {arXiv preprint arXiv:2604.00920},
year = {2026}
}
备注
Accepted at LREC 2026