生成式文本转语音系统中 ExcitNet 模型的有效参数估计方法
音频与语音处理
2019-05-22 v1 机器学习
声音
摘要
本文提出一种采用有效谱与激励估计方法的高质量生成式文本转语音(TTS)系统。我们先前的研究已验证基于 ExcitNet 的语音生成模型在参数化 TTS 框架中的有效性。然而,构建高质量语音合成系统仍具挑战,因为由简单深度神经网络估计的辅助条件特征常含较大预测误差,且这些误差不可避免地在 ExcitNet 声码器的自回归生成过程中传播。为生成更自然的语音信号,我们利用带基于注意力的生成网络(如 Tacotron 2)的序列到序列(seq2seq)声学模型来估计 ExcitNet 声码器的条件参数。由于 seq2seq 声学模型能准确估计谱参数,且 ExcitNet 模型能有效生成相应的时域激励信号,将两者结合可合成自然语音信号。此外,我们采用基于全局风格令牌的情感嵌入方法,验证了所提方法在生成富有表现力语音片段上的优势。实验结果表明,所提系统显著优于配置相似的传统 WaveNet 声码器系统及我们此前最佳的参数化 TTS 对应系统。
引用
@article{arxiv.1905.08486,
title = {Effective parameter estimation methods for an ExcitNet model in generative text-to-speech systems},
author = {Ohsung Kwon and Eunwoo Song and Jae-Min Kim and Hong-Goo Kang},
journal= {arXiv preprint arXiv:1905.08486},
year = {2019}
}
备注
5 pages, 3 figures, 3 tables, submitted to Speech Synthesis Workshop 2019