中文

WaveTTS:基于 Tacotron 的联合时频域损失文本到语音合成

音频与语音处理 2020-04-08 v3 计算与语言 声音

摘要

基于 Tacotron 的文本到语音(TTS)系统直接从文本输入合成语音。此类框架通常由一个将字符序列映射到频域声学特征的特征预测网络,以及一个从声学特征生成时域波形的波形重建算法或神经声码器组成。由于损失函数通常仅针对频域声学特征计算,其无法直接控制所生成时域波形的质量。为解决该问题,我们提出了一种用于基于 Tacotron 的 TTS 的新训练方案,称为 WaveTTS,其具有两个损失函数:1)时域损失,记为波形损失,用于度量自然波形与生成波形之间的失真;2)频域损失,用于度量自然声学特征与生成声学特征之间的梅尔尺度声学特征损失。WaveTTS 同时保证了声学特征与所得语音波形的质量。据我们所知,这是首个采用联合时频域损失的 Tacotron 实现。实验结果表明,所提框架优于基线方法并实现了高质量的合成语音。

关键词

引用

@article{arxiv.2002.00417,
  title  = {WaveTTS: Tacotron-based TTS with Joint Time-Frequency Domain Loss},
  author = {Rui Liu and Berrak Sisman and Feilong Bao and Guanglai Gao and Haizhou Li},
  journal= {arXiv preprint arXiv:2002.00417},
  year   = {2020}
}

备注

To appear at Odyssey 2020, Tokyo, Japan