ÍròyìnSpeech:一个多用途约鲁巴语语音语料库
计算与语言
2024-03-28 v2 声音
音频与语音处理
摘要
我们介绍了 ÍròyìnSpeech,这是一个受增加高质量、当代约鲁巴语语音数据数量需求影响的新语料库,可用于文本转语音(TTS)和自动语音识别(ASR)任务。我们从新闻和创意写作领域筛选了约 23000 条文本句子,采用 CC-BY-4.0 开放许可。为鼓励参与式数据创建,我们向 Mozilla Common Voice 平台提供了 5000 条筛选句子,以众包方式录制并验证约鲁巴语语音数据。总计,我们创建了约 42 小时由 80 名内部志愿者录制的语音数据,以及 6 小时在 Mozilla Common Voice 平台上经验证的录音。我们的 TTS 评估表明,仅需 5 小时语音即可实现高保真、通用领域、单说话人约鲁巴语语音。类似地,对于 ASR 我们获得了 23.8 的基线词错误率(WER)。
引用
@article{arxiv.2307.16071,
title = {\`{I}r\`{o}y\`{i}nSpeech: A multi-purpose Yor\`{u}b\'{a} Speech Corpus},
author = {Tolulope Ogunremi and Kola Tubosun and Anuoluwapo Aremu and Iroro Orife and David Ifeoluwa Adelani},
journal= {arXiv preprint arXiv:2307.16071},
year = {2024}
}
备注
Accepted to LREC-COLING 2024