esCorpius:大规模西班牙语爬取语料库
计算与语言
2022-07-04 v2 人工智能
摘要
近年来,基于 transformer 的模型为自然语言处理中的语言建模带来了显著进展。然而,它们需要海量数据进行(预)训练,且英语以外语言的语料库十分匮乏。最近,若干倡议提出了从自动网络爬取获得的多种语言数据集。但西班牙语的结果存在重要缺陷:与其他语言相比要么规模过小,要么因清洗与去重不够优化而质量低下。本文中,我们介绍 esCorpius,一个从近 1 Pb 的 Common Crawl 数据获取的西班牙语爬取语料库。它是具有此等网页文本内容提取、净化与去重质量的西班牙语中最广泛的语料库。我们的数据整理流程包含一条新颖的高度并行清洗流水线,并涵盖一系列去重机制,共同确保文档与段落边界的完整性。此外,我们保留了源网页 URL 与 WARC 分片来源 URL 以符合欧盟法规。esCorpius 已基于 CC BY-NC-ND 4.0 许可发布,并可在 HuggingFace 上获取。
引用
@article{arxiv.2206.15147,
title = {esCorpius: A Massive Spanish Crawling Corpus},
author = {Asier Gutiérrez-Fandiño and David Pérez-Fernández and Jordi Armengol-Estapé and David Griol and Zoraida Callejas},
journal= {arXiv preprint arXiv:2206.15147},
year = {2022}
}
备注
esCorpius is available on https://huggingface.co/datasets/LHF/escorpius