迈向鲁棒通用神经声码器
音频与语音处理
2019-07-05 v2 声音
摘要
本文探索神经声码器的潜在通用性。我们在来自17种语言的74位说话人上训练了一个基于WaveRNN的声码器。该声码器被证明能够生成持续良好质量的语音(相对于自然语音98%的相对平均MUSHRA),无论输入谱图来自训练期间见过的说话人或风格,还是来自域外场景(当录音条件为工作室质量时)。当录音显示出显著的质量变化,或转向非语音发声或歌唱时,该声码器仍显著优于说话人相关声码器,但平均相对MUSHRA降至75%。这些结果显示在不同语言间具有一致性,无论它们在训练中是否见过(例如英语或日语,或未见过的沃洛夫语、斯瓦希里语、阿姆哈拉语)。
引用
@article{arxiv.1811.06292,
title = {Towards achieving robust universal neural vocoding},
author = {Jaime Lorenzo-Trueba and Thomas Drugman and Javier Latorre and Thomas Merritt and Bartosz Putrycz and Roberto Barra-Chicote and Alexis Moinet and Vatsal Aggarwal},
journal= {arXiv preprint arXiv:1811.06292},
year = {2019}
}
备注
4 pages, 1 extra for references. Accepted on Interspeech 2019