中文

面向语音生成的鲁棒神经声码器:综述

声音 2020-08-21 v3 机器学习 音频与语音处理

摘要

近年来,神经声码器已被广泛应用于语音合成任务,包括文本转语音与语音转换。然而,当训练与推理间出现数据分布失配时,基于真实数据训练的神经声码器在未见场景中的语音质量往往退化。本文中,我们在五个不同数据集上交替训练四种常见神经声码器,包括 WaveNet、WaveRNN、FFTNet、Parallel WaveGAN。为研究神经声码器的鲁棒性,我们使用来自已见/未见说话人、已见/未见语言、一个文本转语音模型及一个语音转换模型的声学特征对模型进行评估。我们发现,相较于语言,说话人多样性对于获得通用声码器更为重要。通过实验,我们表明 WaveNet 与 WaveRNN 更适用于文本转语音模型,而 Parallel WaveGAN 更适用于语音转换应用。文中给出了所有声码器在自然度方面的大量主观 MOS 结果以供后续研究。

关键词

引用

@article{arxiv.1912.02461,
  title  = {Towards Robust Neural Vocoding for Speech Generation: A Survey},
  author = {Po-chun Hsu and Chun-hsuan Wang and Andy T. Liu and Hung-yi Lee},
  journal= {arXiv preprint arXiv:1912.02461},
  year   = {2020}
}

备注

Submitted to INTERSPEECH 2020