LP-WaveNet:基于线性预测的 WaveNet 语音合成
音频与语音处理
2020-03-05 v2 声音
摘要
我们提出了一种通过 WaveNet 声码器框架的线性预测(LP)波形生成方法。基于 WaveNet 的神经声码器显著提升了参数化文本到语音(TTS)系统的质量。然而,当目标数据库包含大量如韵律、风格或表现力等声学信息时,有效训练该神经声码器具有挑战性。作为解决方案,已有仅由神经声码器生成声源分量的方法被提出。但它们往往产生合成噪声,因为声源分量被独立处理而未考虑整个语音产生过程;其中不可避免地出现声源与声道滤波器之间的不匹配。为解决此问题,我们提出 LP-WaveNet 声码器,其中声源与声道分量之间的复杂相互作用在基于混合密度网络的 WaveNet 模型内联合训练。实验结果证实,所提系统在客观与主观上均优于传统 WaveNet 声码器。特别地,该方法在 TTS 框架内取得了 4.47 MOS。
引用
@article{arxiv.1811.11913,
title = {LP-WaveNet: Linear Prediction-based WaveNet Speech Synthesis},
author = {Min-Jae Hwang and Frank Soong and Eunwoo Song and Xi Wang and Hyeonjoo Kang and Hong-Goo Kang},
journal= {arXiv preprint arXiv:1811.11913},
year = {2020}
}
备注
Submitted to EUSIPCO 2020