中文

NusaCrowd:面向印尼语自然语言处理资源的开源倡议

计算与语言 2023-07-24 v4 人工智能

摘要

我们提出了 NusaCrowd,一项旨在收集和统一现有印尼语资源的协作倡议,包括开放对先前非公开资源的访问。通过此倡议,我们汇集了 137 个数据集和 118 个标准化数据加载器。数据集的质量已通过人工和自动方式评估,其价值通过多项实验得以证明。NusaCrowd 的数据收集使得能够为印尼语及其地方语言创建首个零样本自然语言理解与生成基准。此外,NusaCrowd 还促成了首个面向印尼语及其地方语言的多语言自动语音识别基准的创建。我们的工作致力于推动那些虽被广泛使用但代表性不足的语言的自然语言处理(NLP)研究。

关键词

引用

@article{arxiv.2212.09648,
  title  = {NusaCrowd: Open Source Initiative for Indonesian NLP Resources},
  author = {Samuel Cahyawijaya and Holy Lovenia and Alham Fikri Aji and Genta Indra Winata and Bryan Wilie and Rahmad Mahendra and Christian Wibisono and Ade Romadhony and Karissa Vincentio and Fajri Koto and Jennifer Santoso and David Moeljadi and Cahya Wirawan and Frederikus Hudi and Ivan Halim Parmonangan and Ika Alfina and Muhammad Satrio Wicaksono and Ilham Firdausi Putra and Samsul Rahmadani and Yulianti Oenang and Ali Akbar Septiandri and James Jaya and Kaustubh D. Dhole and Arie Ardiyanti Suryani and Rifki Afina Putri and Dan Su and Keith Stevens and Made Nindyatama Nityasya and Muhammad Farid Adilazuarda and Ryan Ignatius and Ryandito Diandaru and Tiezheng Yu and Vito Ghifari and Wenliang Dai and Yan Xu and Dyah Damapuspita and Cuk Tho and Ichwanul Muslim Karo Karo and Tirana Noor Fatyanosa and Ziwei Ji and Pascale Fung and Graham Neubig and Timothy Baldwin and Sebastian Ruder and Herry Sujaini and Sakriani Sakti and Ayu Purwarianti},
  journal= {arXiv preprint arXiv:2212.09648},
  year   = {2023}
}