语言模型关心文本质量吗?评估 11 种语言的网络爬取语料库
计算与语言
2024-03-14 v1
摘要
大型、经过整理的网页爬取语料库在训练语言模型 (LM) 中扮演着至关重要的角色。它们构成了几乎所有近期语言模型(如著名的 GPT、LLaMA 和 XLM-RoBERTa 模型)训练数据的主体部分。然而,尽管其重要性如此之高,对这些语料库质量的关注却相对较少。在本文中,我们比较了当前最相关的四个大型网页爬取语料库(CC100、MaCoCu、mC4 和 OSCAR),涵盖 11 种资源较少的欧洲语言。我们的方法分为两步:首先,我们通过对取自不同语料库的样本进行人工质量评估,执行内在评价;然后,我们通过在每个语料库上训练特定的语言模型并评估它们在下游任务上的表现,来评估质量差异的实际影响。我们发现语料库的质量存在明显差异,其中 MaCoCu 和 OSCAR 获得了最佳结果。然而,在外在评价中,我们实际上发现 CC100 语料库取得了最高分。我们得出结论,在我们的实验中,网页爬取语料库的质量在训练语言模型时似乎并未发挥显著作用。
引用
@article{arxiv.2403.08693,
title = {Do Language Models Care About Text Quality? Evaluating Web-Crawled Corpora Across 11 Languages},
author = {Rik van Noord and Taja Kuzman and Peter Rupnik and Nikola Ljubešić and Miquel Esplà-Gomis and Gema Ramírez-Sánchez and Antonio Toral},
journal= {arXiv preprint arXiv:2403.08693},
year = {2024}
}
备注
Accepted to LREC-COLING 2024 (long)