中文

你的维基百科质量如何?低资源和多语言自然语言处理的数据质量审计

计算与语言 2026-05-05 v3

摘要

维基百科所 perceived 的高质量和广泛的语言覆盖使其成为自然语言处理领域的一项基础资源。然而,近年来在高资源和多语言语境下,这种高质量假设已成为审视的对象。在本研究中,我们对全部非英语维基百科实施了通常保留给噪声网页文本的数据过滤流程——该过程移除了集合中大量数据。在分析被移除的数据时,我们揭示了许多系统性质量问题,如脚本和语言污染、重复的模板和占位文章,以及大量机器人生成的内容。我们将这些发现整合为一个四级维基百科质量排名,该排名与替代质量度量和启发式方法具有强对应关系。最后,我们在三个实用语言建模场景中评估了质量过滤的下游影响,结果表明基于过滤数据训练的模型在整体上匹配或超越了基于原始维基百科训练的模型,其中低质量语言版本的提升最为显著。最终,我们的实验是建立维基百科在自然语言处理中质量感知最佳实践的第一步,为未来的数据集创建和策展工作奠定了基础。

关键词

引用

@article{arxiv.2411.05527,
  title  = {How Good is Your Wikipedia? Auditing Data Quality for Low-resource and Multilingual NLP},
  author = {Kushal Tatariya and Artur Kulmizev and Wessel Poelman and Esther Ploeger and Marcel Bollmann and Johannes Bjerva and Jiaming Luo and Heather Lent and Miryam de Lhoneux},
  journal= {arXiv preprint arXiv:2411.05527},
  year   = {2026}
}

备注

Accepted to ACL Main, 2026