中文

未被听见的声音:约鲁巴语区域方言的 NLP 资源与模型

计算与语言 2024-07-01 v1

摘要

约鲁巴语是一种拥有约4700万使用者的非洲语言,包含由多种方言组成的连续体。近期为非洲语言开发NLP技术的努力集中在其标准方言上,导致对于几乎没有或完全缺乏资源或工具的方言和变体产生了差异。我们通过引入一个新的高质量平行文本与语音语料库YOR\`ULECT来迈出弥合这一差距的步伐,该语料库涵盖三个领域和四种约鲁巴语区域方言。为了开发该语料库,我们深入这些方言被使用的社区,与母语使用者合作收集文本和语音数据。利用我们新创建的语料库,我们在(文本)机器翻译、自动语音识别和语音到文本翻译方面进行了广泛的实验。我们的结果显示,在所有任务中,标准约鲁巴语与其他方言之间存在显著的性能差异。然而,我们也表明,通过方言自适应微调,我们能够缩小这一差距。我们相信,通过增进我们对现有挑战的理解并提供用于进一步开发的高质量数据集,我们的数据集和实验分析将极大地促进为约鲁巴语及其方言,并潜在地为其他非洲语言开发NLP工具。我们在开放许可下公开发布YOR\`ULECT数据集和模型。

关键词

引用

@article{arxiv.2406.19564,
  title  = {Voices Unheard: NLP Resources and Models for Yor\`ub\'a Regional Dialects},
  author = {Orevaoghene Ahia and Anuoluwapo Aremu and Diana Abagyan and Hila Gonen and David Ifeoluwa Adelani and Daud Abolade and Noah A. Smith and Yulia Tsvetkov},
  journal= {arXiv preprint arXiv:2406.19564},
  year   = {2024}
}