中文

增强面向文本转语音模型的众包音频

音频与语音处理 2024-10-18 v1 声音

摘要

高质量音频数据是训练稳健文本转语音模型的关键前提,这往往限制了机会式或众包数据集的使用。本文提出了一种方法,通过在已知内在噪声和变异性的Commonvoice加泰罗尼亚语子集上实施降噪管道来克服这一限制。该管道包含音频增强阶段和选择性过滤策略。我们开发了基于非侵入式语音质量评估(NISQA)模型的自动过滤机制,用于识别并保留增强后最高质量的样本。为评估这种方法的有效性,我们在处理后的数据集上训练了一个最先进的扩散基文本转语音模型。结果显示,与未经增强的基准数据集相比,UTMOS分数提升了0.4。这一方法为扩大众包数据在TTS应用中的实用性具有前景,特别是对于像加泰罗尼亚语这样的中低资源语言。

引用

@article{arxiv.2410.13357,
  title  = {Enhancing Crowdsourced Audio for Text-to-Speech Models},
  author = {José Giraldo and Martí Llopart-Font and Alex Peiró-Lilja and Carme Armentano-Oller and Gerard Sant and Baybars Külebi},
  journal= {arXiv preprint arXiv:2410.13357},
  year   = {2024}
}

备注

Submitted to Iberspeech 2024