中文

利用对抗声码器加速 TTS 合成

声音 2019-07-29 v2 机器学习 音频与语音处理

摘要

最近在文本转语音(TTS)合成的方法中,采用神经网络策略将感知信息频谱图表示直接声码化为可听波形。这种声码化过程在现代 TTS 流水线中造成了计算瓶颈。我们提出了一种替代方法,利用生成对抗网络(GANs)学习从感知信息频谱图到简单幅度频谱图的映射,后者可以通过启发式方法进行声码化。通过一项用户研究,我们表明我们的方法显著优于朴素声码化策略,同时比最先进 TTS 系统中使用的神经网络声码器快数百倍。我们还表明,我们的方法可用于在单个语音词的无监督合成中取得最先进的结果。

关键词

引用

@article{arxiv.1904.07944,
  title  = {Expediting TTS Synthesis with Adversarial Vocoding},
  author = {Paarth Neekhara and Chris Donahue and Miller Puckette and Shlomo Dubnov and Julian McAuley},
  journal= {arXiv preprint arXiv:1904.07944},
  year   = {2019}
}

备注

Published as a conference paper at INTERSPEECH 2019