以VAE潜向量为条件的并行WaveNet
音频与语音处理
2020-12-18 v1 声音
摘要
近来,最先进的文本到语音合成系统已转向双模型方法:一个序列到序列模型预测语音的表示(通常为梅尔谱图),随后一个“神经声码器”模型从该中间语音表示生成时域语音波形。该方法能够合成与自然语音录音难以区分的语音。然而,神经声码器方法的推理速度代表了将该技术部署于商业应用的主要障碍。并行WaveNet是为解决此问题而开发的一种方法,以部分合成质量换取显著更快的推理速度。在本文中,我们研究使用句子级条件向量来改善并行WaveNet神经声码器的信号质量。我们用来自Tacotron 2风格序列到序列模型的预训练VAE组件的潜向量来条件化该神经声码器。借此,我们能够显著提升声码器合成语音的质量。
引用
@article{arxiv.2012.09703,
title = {Parallel WaveNet conditioned on VAE latent vectors},
author = {Jonas Rohnke and Tom Merritt and Jaime Lorenzo-Trueba and Adam Gabrys and Vatsal Aggarwal and Alexis Moinet and Roberto Barra-Chicote},
journal= {arXiv preprint arXiv:2012.09703},
year = {2020}
}