构建基于众包数据的乌干拉语文本转语音模型
声音
2024-05-17 v1 计算与语言
音频与语音处理
摘要
非洲语言如乌干拉语的文本转语音(TTS)开发仍受限,主要由于缺乏高质量、单说话人录音,这些录音是训练TTS模型所必需的。以往工作主要利用乌干拉语Common Voice录音,涵盖多个20-49岁的说话人。虽然生成的语音可理解,但仍低于基于录音棚级录音训练的模型质量。这源于对不足的Common Voice录音进行数据预处理以提升质量的方法不足。此外,由于语调变化以及背景噪声,语音收敛更加困难。本文展示,通过在多个语调接近的说话人上训练,以及进一步处理训练数据,可提高乌干拉语TTS的质量。具体而言,我们选取了六位语调接近的女性说话人,通过主观倾听和比较其语音录音确定语调相似性。除去除去录音开头和结尾的静默部分外,我们应用预训练的语音增强模型以减少背景噪声并提升音频质量。我们还利用预训练的、非侵入式的自监督Mean Opinion Score(MOS)估计模型,以筛选估计MOS超过3.5的录音(表明高感知质量)。来自九位母语乌干拉语说话人的主观MOS评估表明,我们的TTS模型实现了显著更好的MOS值3.55,与现有模型报告的2.5 MOS相比。此外,为进行公平比较,我们的模型在六位说话人上训练的模型优于单说话人(3.13 MOS)或两位说话人(3.22 MOS)训练的模型。这表明,用多个语调接近的说话人的数据来弥补单位说话人数据的不足,能够有效提升TTS质量。
引用
@article{arxiv.2405.10211,
title = {Building a Luganda Text-to-Speech Model From Crowdsourced Data},
author = {Sulaiman Kagumire and Andrew Katumba and Joyce Nakatumba-Nabende and John Quinn},
journal= {arXiv preprint arXiv:2405.10211},
year = {2024}
}
备注
Presented at the AfricaNLP workshop at ICLR 2024