GlotCC:面向小语种的开源广覆盖 CommonCrawl 语料库与流水线
计算与语言
2025-03-05 v2 人工智能
摘要
随着预训练语言模型的出现,特别是这些模型缩放定律的发现,对大型文本语料库的需求日益增加。大多数可用语料库仅对拥有庞大主导社区的语言有足够的数据。然而,目前尚无一个语料库能够 (i) 覆盖广泛的小语种;(ii) 由开源可复现的流水线生成;(iii) 经过严格的噪声清洗,使其使用可靠。我们推出了 GlotCC,一个源自 CommonCrawl 的、经过清洗的、文档级别的 2TB 通用领域语料库,覆盖超过 1000 种语言。我们将 GlotCC 及其生成系统——包括流水线、语言识别模型和过滤器——提供给研究社区。语料库 v. 1.0 https://huggingface.co/datasets/cis-lmu/GlotCC-v1,流水线 v. 3.0 https://github.com/cisnlp/GlotCC。
引用
@article{arxiv.2410.23825,
title = {GlotCC: An Open Broad-Coverage CommonCrawl Corpus and Pipeline for Minority Languages},
author = {Amir Hossein Kargaran and François Yvon and Hinrich Schütze},
journal= {arXiv preprint arXiv:2410.23825},
year = {2025}
}
备注
NeurIPS 2024