采用生成式建模激励声码器的神经文本到语音系统
音频与语音处理
2020-08-04 v1
摘要
本文提出一种用于神经文本到语音(TTS)系统的生成式建模(MbG)激励声码器。近期提出的神经激励声码器可通过将声道滤波器与基于WaveNet的声门激励生成器相结合来实现合格的波形生成。然而,当这些声码器用于TTS系统时,由于训练与合成步骤之间的不匹配,合成语音的质量常会下降。具体而言,声码器与声学模型前端分开训练。因此,声学模型的估计误差在声码器后端的合成过程中不可避免地会被放大。为解决此问题,我们提出将MbG结构引入声码器的训练过程。在所提方法中,激励信号由声学模型生成的谱参数提取,然后神经声码器不仅被优化以学习目标激励的分布,还补偿声学模型产生的估计误差。此外,由于生成的谱参数在训练与合成步骤中共享,其不匹配状况可有效减少。实验结果验证,所提系统在TTS框架内以4.57的平均意见得分提供了高质量合成语音。
引用
@article{arxiv.2008.00132,
title = {Neural text-to-speech with a modeling-by-generation excitation vocoder},
author = {Eunwoo Song and Min-Jae Hwang and Ryuichi Yamamoto and Jin-Seob Kim and Ohsung Kwon and Jae-Min Kim},
journal= {arXiv preprint arXiv:2008.00132},
year = {2020}
}
备注
Accepted to the conference of INTERSPEECH 2020