中文

说话人条件WaveRNN:面向未见说话人与录音条件的通用神经声码器

音频与语音处理 2020-08-13 v1 机器学习 声音

摘要

深度学习的近期进展使单说话人语音合成达到人类水平表现。然而,在将这些系统推广至多说话人模型时,尤其在未见说话人与未见录音质量方面,语音质量仍存在局限。例如,常规神经声码器针对训练说话人调整,对未见说话人的泛化能力较差。本工作中,我们提出WaveRNN的一种变体,称为说话人条件WaveRNN(SC-WaveRNN)。我们致力于开发一种即便对未见说话人与录音条件也高效的通用声码器。与标准WaveRNN不同,SC-WaveRNN利用了以说话人嵌入形式给出的额外信息。使用公开可用数据训练,SC-WaveRNN在主观与客观指标上均显著优于基线WaveRNN。在MOS(平均意见得分)上,SC-WaveRNN在已见说话人与已见录音条件下提升约23%,在未见说话人与未见条件下提升高达95%。最后,我们通过实现类似于零样本说话人自适应的多说话人文本到语音(TTS)合成扩展了本工作。在性能方面,对于已见与未见说话人,我们的系统分别以60%对15.5%和60.9%对32.6%优于基线TTS系统。

关键词

引用

@article{arxiv.2008.05289,
  title  = {Speaker Conditional WaveRNN: Towards Universal Neural Vocoder for Unseen Speaker and Recording Conditions},
  author = {Dipjyoti Paul and Yannis Pantazis and Yannis Stylianou},
  journal= {arXiv preprint arXiv:2008.05289},
  year   = {2020}
}

备注

Accepted in INTERSPEECH 2020