基于 RNN 的使用连续正弦模型的语音合成
声音
2019-04-16 v1 音频与语音处理
摘要
最近在统计参数语音合成中,我们提出了一种连续正弦模型(CSM),该模型使用连续基频(contF0)结合最大浊音频率(MVF),在合成语音中成功给出了最先进的声码器性能(例如类似于 STRAIGHT)。在本文中,我们探讨使用基于循环神经网络(RNN)的序列到序列建模。研究并应用了双向长短期记忆(Bi-LSTM)利用我们的 CSM 对 contF0、MVF 和梅尔广义倒谱(MGC)进行建模,以获得更自然的合成语音。为了细化 contF0 估计的输出,应用基于时间扭曲方法的后处理以减少非浊音语音中不需要的浊音成分,从而得到增强的 contF0 轨迹。总体结论由客观评估和主观听音测试覆盖,表明所提出的框架在自然度和可懂度方面提供了令人满意的结果,并且可与基于高质量 WORLD 模型的 RNN 相媲美。
引用
@article{arxiv.1904.06075,
title = {RNN-based speech synthesis using a continuous sinusoidal model},
author = {Mohammed Salah Al-Radhi and Tamás Gábor Csapó and Géza Németh},
journal= {arXiv preprint arXiv:1904.06075},
year = {2019}
}
备注
8 pages, 4 figures, Accepted to IJCNN 2019