中文

迈向鲁棒通用神经声码器

音频与语音处理 2019-07-05 v2 声音

摘要

本文探索神经声码器的潜在通用性。我们在来自17种语言的74位说话人上训练了一个基于WaveRNN的声码器。该声码器被证明能够生成持续良好质量的语音(相对于自然语音98%的相对平均MUSHRA),无论输入谱图来自训练期间见过的说话人或风格,还是来自域外场景(当录音条件为工作室质量时)。当录音显示出显著的质量变化,或转向非语音发声或歌唱时,该声码器仍显著优于说话人相关声码器,但平均相对MUSHRA降至75%。这些结果显示在不同语言间具有一致性,无论它们在训练中是否见过(例如英语或日语,或未见过的沃洛夫语、斯瓦希里语、阿姆哈拉语)。

关键词

引用

@article{arxiv.1811.06292,
  title  = {Towards achieving robust universal neural vocoding},
  author = {Jaime Lorenzo-Trueba and Thomas Drugman and Javier Latorre and Thomas Merritt and Bartosz Putrycz and Roberto Barra-Chicote and Alexis Moinet and Vatsal Aggarwal},
  journal= {arXiv preprint arXiv:1811.06292},
  year   = {2019}
}

备注

4 pages, 1 extra for references. Accepted on Interspeech 2019