用于文本到语音系统神经声码器失配精炼的循环后滤波方法
音频与语音处理
2020-08-10 v2 声音
摘要
近来,结合神经声码器的文本到语音(TTS)系统生成高保真语音的有效性已得到证实。然而,收集所需训练数据并从零构建这些先进系统耗时耗力。一种经济的方法是开发神经声码器以增强现有或低成本的 TTS 系统所生成的语音。尽管如此,该方法通常面临两个问题:1) TTS 与自然波形间的时间失配;2) 训练与测试数据间的声学失配。为解决这些问题,我们采用循环语音转换(VC)模型生成时间匹配的伪 VC 数据用于训练,以及声学匹配的增强数据用于测试神经声码器。由于通用性,该框架可应用于任意 TTS 系统与神经声码器。本文中,我们将所提方法与最先进的 WaveNet 声码器应用于两种不同基础 TTS 系统,客观与主观实验结果均证实了该框架的有效性。
引用
@article{arxiv.2005.08659,
title = {A Cyclical Post-filtering Approach to Mismatch Refinement of Neural Vocoder for Text-to-speech Systems},
author = {Yi-Chiao Wu and Patrick Lumban Tobing and Kazuki Yasuhara and Noriyuki Matsunaga and Yamato Ohtani and Tomoki Toda},
journal= {arXiv preprint arXiv:2005.08659},
year = {2020}
}
备注
5 pages, 8 figures, 1 table. Proc. Interspeech, 2020