非洲语言自动语音识别的人工合成语音数据
计算与语言
2025-11-10 v1
摘要
语音技术仍然无法覆盖非洲超过2300种语言的大多数语言。我们首次系统评估了大规模人工语音语料库用于非洲语音识别。我们采用三步方法:LLM驱动的文本创建、TTS语音合成和ASR微调。我们创建了十种语言中的八种人工文本,阅读评分均超过7分中的5分。我们评估了对三种语言(豪萨语、德HOLUO语、奇切韦语)的ASR改进,并创建了超过2500小时的人工语音数据,其成本不足真实数据的1%。在250小时真实数据和250小时人工豪萨语数据上微调的Wav2Vec-BERT-2.0模型,匹配了500小时真实数据基线;250小时真实数据和450小时至993小时人工数据的组合取得最佳性能。我们还呈现了按性别划分的ASR性能评估。对于极低资源语言,收益变化:奇切韦语WER在1:2真实数据与人工数据比例下约提高6.5%;德HOLUO语的1:1比例在某些评估数据上显示类似改进,但在其他数据上未显示。调查编码者可靠性、ASR错误和评估数据集,揭示了需要更健壮的审核程序和更准确的评估数据的需求。所有数据和模型均公开发布,以邀请进一步工作改进非洲语言的人工数据。
引用
@article{arxiv.2507.17578,
title = {Synthetic Voice Data for Automatic Speech Recognition in African Languages},
author = {Brian DeRenzi and Anna Dixon and Mohamed Aymane Farhi and Christian Resch},
journal= {arXiv preprint arXiv:2507.17578},
year = {2025}
}
备注
29 pages incl. appendix, 8 tables, 5 figures. Authors are listed in alphabetical order