中文

GlotCC:面向小语种的开源广覆盖 CommonCrawl 语料库与流水线

计算与语言 2025-03-05 v2 人工智能

摘要

随着预训练语言模型的出现,特别是这些模型缩放定律的发现,对大型文本语料库的需求日益增加。大多数可用语料库仅对拥有庞大主导社区的语言有足够的数据。然而,目前尚无一个语料库能够 (i) 覆盖广泛的小语种;(ii) 由开源可复现的流水线生成;(iii) 经过严格的噪声清洗,使其使用可靠。我们推出了 GlotCC,一个源自 CommonCrawl 的、经过清洗的、文档级别的 2TB 通用领域语料库,覆盖超过 1000 种语言。我们将 GlotCC 及其生成系统——包括流水线、语言识别模型和过滤器——提供给研究社区。语料库 v. 1.0 https://huggingface.co/datasets/cis-lmu/GlotCC-v1,流水线 v. 3.0 https://github.com/cisnlp/GlotCC。

关键词

引用

@article{arxiv.2410.23825,
  title  = {GlotCC: An Open Broad-Coverage CommonCrawl Corpus and Pipeline for Minority Languages},
  author = {Amir Hossein Kargaran and François Yvon and Hinrich Schütze},
  journal= {arXiv preprint arXiv:2410.23825},
  year   = {2025}
}

备注

NeurIPS 2024