中文

NusaWrites:为低资源及极低资源代表性不足语言构建高质量语料库

计算与语言 2023-09-21 v2 人工智能

摘要

使自然语言处理(NLP)技术普惠可及至关重要,尤其对于代表性不足和极低资源的语言。先前研究通过在线抓取与文档翻译为这些语言开发标注与未标注语料库。尽管这些方法已被证明有效且具成本效益,我们发现所得语料库存在局限性,包括缺乏词汇多样性及与本地社区的文化相关性。为弥补此缺口,我们以印尼本地语言为案例研究。我们比较了在线抓取、人工翻译与母语者段落写作在构建数据集上的有效性。我们的发现表明,由母语者段落写作生成的数据集在词汇多样性与文化内容方面展现更优质量。此外,我们提出\datasetname{}基准,涵盖印尼数百万使用者所讲的12种代表性不足与极低资源语言。使用现有多语言大语言模型的实证实验结果指明需将这些模型扩展至更多代表性不足语言。我们在 https://github.com/IndoNLP/nusa-writes 发布NusaWrites数据集。

关键词

引用

@article{arxiv.2309.10661,
  title  = {NusaWrites: Constructing High-Quality Corpora for Underrepresented and Extremely Low-Resource Languages},
  author = {Samuel Cahyawijaya and Holy Lovenia and Fajri Koto and Dea Adhista and Emmanuel Dave and Sarah Oktavianti and Salsabil Maulana Akbar and Jhonson Lee and Nuur Shadieq and Tjeng Wawan Cenggoro and Hanung Wahyuning Linuwih and Bryan Wilie and Galih Pradipta Muridan and Genta Indra Winata and David Moeljadi and Alham Fikri Aji and Ayu Purwarianti and Pascale Fung},
  journal= {arXiv preprint arXiv:2309.10661},
  year   = {2023}
}