中文

ZAEBUC-Spoken:一个多语言多方言阿拉伯语-英语语音语料库

计算与语言 2024-03-28 v1

摘要

我们提出了 ZAEBUC-Spoken,一个多语言多方言阿拉伯语-英语语音语料库。该语料库包含十二小时的 Zoom 会议,涉及多名说话人进行角色扮演,模拟工作场景:学生就某一主题进行头脑风暴,随后与对话者进行讨论。这些会议涵盖不同主题,并划分为具有不同语言设置的阶段。该语料库为自动语音识别(ASR)提供了一组具有挑战性的数据,包含两种语言(阿拉伯语和英语),其中阿拉伯语具有多种变体(现代标准阿拉伯语、海湾阿拉伯语和埃及阿拉伯语),英语带有各种口音。增加了该语料库复杂性的还有这些语言和方言之间的语码转换。作为我们工作的一部分,我们借鉴现有的转录指南,提出了一套处理对话语音、语码转换以及两种语言正字法问题的指南。我们进一步用两层标注丰富了该语料库:(1)针对阿拉伯语不同变体发生混合的语料库部分进行方言程度标注,以及(2)自动形态学标注,包括词元化、词形还原和词性标注。

关键词

引用

@article{arxiv.2403.18182,
  title  = {ZAEBUC-Spoken: A Multilingual Multidialectal Arabic-English Speech Corpus},
  author = {Injy Hamed and Fadhl Eryani and David Palfreyman and Nizar Habash},
  journal= {arXiv preprint arXiv:2403.18182},
  year   = {2024}
}

备注

Accepted to LREC-COLING 2024