语料库质量对低资源语言真的很重要吗?
计算与语言
2022-10-27 v2 人工智能
机器学习
摘要
绝大多数非英语语料库都源自 CommonCrawl 的自动过滤版本。虽然先前工作已指出这些数据集在质量上的主要问题(Kreutzer 等人,2021),但尚不清楚这如何影响下游性能。以巴斯克语的表示学习为案例研究,我们探索了定制爬取(手动识别并抓取具有高质量内容的网站)作为过滤 CommonCrawl 的替代方案。我们的新语料库称为 EusCrawl,其规模与 CC100 和 mC4 等流行多语言语料库的巴斯克语部分相似,但根据母语标注者的判断其质量要高得多。例如,EusCrawl 中 66% 的文档被评为高质量,而 mC4 和 CC100 均不到 33%。尽管如此,无论使用哪个语料库进行预训练,我们在下游 NLU 任务上获得了相似的结果。我们的工作表明,低资源语言的 NLU 性能并非主要受制于数据质量,而语料库规模和领域覆盖等其他因素可能发挥更重要的作用。
引用
@article{arxiv.2203.08111,
title = {Does Corpus Quality Really Matter for Low-Resource Languages?},
author = {Mikel Artetxe and Itziar Aldabe and Rodrigo Agerri and Olatz Perez-de-Viñaspre and Aitor Soroa},
journal= {arXiv preprint arXiv:2203.08111},
year = {2022}
}
备注
EMNLP 2022