中文

一览质量:对网络爬取多语言数据集的审计

计算与语言 2022-02-22 v4 人工智能

摘要

随着大规模预训练和多语言建模在自然语言处理(NLP)中的成功,近年来出现了大量覆盖数百种语言的、经网络挖掘的大型文本数据集。我们手动审计了随五个主要公共数据集(CCAligned、ParaCrawl、WikiMatrix、OSCAR、mC4)发布的 205 个特定语言语料库的质量。低资源语料库存在系统性问题:至少 15 个语料库没有可用文本,且显著一部分包含少于 50% 可接受质量的句子。此外,许多语料库被错误标注或使用了非标准/有歧义的语言代码。我们证明,即使对非熟练使用者而言,这些问题也易于检测,并以自动分析补充人工审计。最后,我们推荐了评估和改进多语言语料库的技术,并讨论了低质量数据发布带来的潜在风险。

关键词

引用

@article{arxiv.2103.12028,
  title  = {Quality at a Glance: An Audit of Web-Crawled Multilingual Datasets},
  author = {Julia Kreutzer and Isaac Caswell and Lisa Wang and Ahsan Wahab and Daan van Esch and Nasanbayar Ulzii-Orshikh and Allahsera Tapo and Nishant Subramani and Artem Sokolov and Claytone Sikasote and Monang Setyawan and Supheakmungkol Sarin and Sokhar Samb and Benoît Sagot and Clara Rivera and Annette Rios and Isabel Papadimitriou and Salomey Osei and Pedro Ortiz Suarez and Iroro Orife and Kelechi Ogueji and Andre Niyongabo Rubungo and Toan Q. Nguyen and Mathias Müller and André Müller and Shamsuddeen Hassan Muhammad and Nanda Muhammad and Ayanda Mnyakeni and Jamshidbek Mirzakhalov and Tapiwanashe Matangira and Colin Leong and Nze Lawson and Sneha Kudugunta and Yacine Jernite and Mathias Jenny and Orhan Firat and Bonaventure F. P. Dossou and Sakhile Dlamini and Nisansa de Silva and Sakine Çabuk Ballı and Stella Biderman and Alessia Battisti and Ahmed Baruwa and Ankur Bapna and Pallavi Baljekar and Israel Abebe Azime and Ayodele Awokoya and Duygu Ataman and Orevaoghene Ahia and Oghenefego Ahia and Sweta Agrawal and Mofetoluwa Adeyemi},
  journal= {arXiv preprint arXiv:2103.12028},
  year   = {2022}
}

备注

Accepted at TACL; pre-MIT Press publication version