中文

ÍròyìnSpeech:一个多用途约鲁巴语语音语料库

计算与语言 2024-03-28 v2 声音 音频与语音处理

摘要

我们介绍了 ÍròyìnSpeech,这是一个受增加高质量、当代约鲁巴语语音数据数量需求影响的新语料库,可用于文本转语音(TTS)和自动语音识别(ASR)任务。我们从新闻和创意写作领域筛选了约 23000 条文本句子,采用 CC-BY-4.0 开放许可。为鼓励参与式数据创建,我们向 Mozilla Common Voice 平台提供了 5000 条筛选句子,以众包方式录制并验证约鲁巴语语音数据。总计,我们创建了约 42 小时由 80 名内部志愿者录制的语音数据,以及 6 小时在 Mozilla Common Voice 平台上经验证的录音。我们的 TTS 评估表明,仅需 5 小时语音即可实现高保真、通用领域、单说话人约鲁巴语语音。类似地,对于 ASR 我们获得了 23.8 的基线词错误率(WER)。

关键词

引用

@article{arxiv.2307.16071,
  title  = {\`{I}r\`{o}y\`{i}nSpeech: A multi-purpose Yor\`{u}b\'{a} Speech Corpus},
  author = {Tolulope Ogunremi and Kola Tubosun and Anuoluwapo Aremu and Iroro Orife and David Ifeoluwa Adelani},
  journal= {arXiv preprint arXiv:2307.16071},
  year   = {2024}
}

备注

Accepted to LREC-COLING 2024