中文

超越数据集计数:多语言数据集构建与必要资源综述

计算与语言 2022-11-29 v1 人工智能

摘要

尽管自然语言处理(NLP)社区普遍意识到语言间的资源差异,但我们缺乏量化这种差异程度和类型的研究。先前基于数据集数量来估计资源可用性的调查可能具有误导性,因为数据集质量参差不齐:许多数据集是从英文数据自动归纳或翻译而来的。为了提供更全面的语言资源图景,我们考察了 156 个公开可用的 NLP 数据集的特征。我们手动标注了它们的创建方式,包括输入文本和标签来源以及用于构建它们的工具,并标注了它们研究的内容、处理的任务以及创建动机。在量化了跨语言的定性 NLP 资源差距后,我们讨论了如何改进低资源语言的数据收集。我们调查了每种语言精通语言的 NLP 研究人员和众包工作者,发现他们的估计可用性与数据集可用性相关。通过众包实验,我们确定了在 Mechanical Turk 平台上收集高质量多语言数据的策略。最后,我们向 NLP 社区和个体研究人员提出了宏观和微观层面的建议,以促进未来的多语言数据发展。

关键词

引用

@article{arxiv.2211.15649,
  title  = {Beyond Counting Datasets: A Survey of Multilingual Dataset Construction and Necessary Resources},
  author = {Xinyan Velocity Yu and Akari Asai and Trina Chatterjee and Junjie Hu and Eunsol Choi},
  journal= {arXiv preprint arXiv:2211.15649},
  year   = {2022}
}

备注

Accepted to Findings of EMNLP 2022. You can view our annotations, contribute to our survey, and view the analysis visualizations on our website at https://multilingual-dataset-survey.github.io