利用线性预测结构混合密度网络改进基于 LPCNet 的文本到语音合成
音频与语音处理
2020-02-03 v1
摘要
本文提出一种使用线性预测(LP)结构混合密度网络(MDN)的改进 LPCNet 声码器。近期提出的 LPCNet 声码器通过将声道 LP 滤波器与基于 WaveRNN 的声源(即激励)生成器相结合,成功实现了高质量且轻量级的语音合成系统。然而,由于声源分量由 mu-law 量化方法表示不充分,且模型训练时未考虑整体语音产生机制,合成语音的质量往往不稳定。为解决该问题,我们首先引入 LP-MDN,使自回归神经声码器能够从结构上表示声道与声源分量之间的相互作用。接着,我们提出用连续密度分布替代传统的离散化输出,将 LP-MDN 整合到 LPCNet 声码器中。实验结果验证,所提系统在文本到语音框架下取得了 4.41 的平均意见得分,提供了高质量的合成语音。
引用
@article{arxiv.2001.11686,
title = {Improving LPCNet-based Text-to-Speech with Linear Prediction-structured Mixture Density Network},
author = {Min-Jae Hwang and Eunwoo Song and Ryuichi Yamamoto and Frank Soong and Hong-Goo Kang},
journal= {arXiv preprint arXiv:2001.11686},
year = {2020}
}
备注
Accepted to ICASSP 2020