ExcitNet声码器:一种用于参数语音合成系统的神经激励模型
音频与语音处理
2019-08-23 v3 机器学习
声音
摘要
本文提出一种基于WaveNet的神经激励模型(ExcitNet),用于统计参数语音合成系统。传统的基于WaveNet的神经声码化系统通过自回归框架统计生成语音波形的时间序列,显著改善了合成语音的感知质量。然而,由于难以捕捉语音信号复杂的时变特性,它们常常受到噪声输出的困扰。为提高建模效率,所提出的ExcitNet声码器采用自适应逆滤波器将频谱分量从语音信号中解耦。然后,残差分量即激励信号,在WaveNet框架内被训练并生成。通过这种方式,合成语音信号的质量可进一步提升,因为频谱分量由深度学习框架良好表示,且残差分量由WaveNet框架高效生成。实验结果表明,所提出的ExcitNet声码器在说话人相关和说话人无关训练下,均优于传统的线性预测声码器和配置相似的传统WaveNet声码器。
引用
@article{arxiv.1811.04769,
title = {ExcitNet vocoder: A neural excitation model for parametric speech synthesis systems},
author = {Eunwoo Song and Kyungguen Byun and Hong-Goo Kang},
journal= {arXiv preprint arXiv:1811.04769},
year = {2019}
}
备注
Accepted to the conference of EUSIPCO 2019. arXiv admin note: text overlap with arXiv:1811.03311