基于多源 Tacotron 与 WaveNet 的语音合成与语音转换联合训练框架
音频与语音处理
2019-04-09 v2 计算与语言
声音
机器学习
摘要
我们研究了针对语音合成(TTS)与语音转换(VC)任务训练共享模型的方法。我们提出采用 Tacotron 的扩展模型架构,即具有双注意力机制的多源序列到序列模型,作为 TTS 与 VC 任务的共享模型。该模型可根据输入类型分别完成这两项不同任务。当模型以文本作为输入时进行端到端语音合成任务,而当以源说话人语音作为输入时进行序列到序列语音转换任务。波形信号由 WaveNet 生成,其以预测的梅尔谱图为条件。我们提出联合训练一个作为目标说话人解码器、支持多源的共享模型。听感实验表明,我们提出的多源编码器-解码器模型能高效实现 TTS 与 VC 两项任务。
引用
@article{arxiv.1903.12389,
title = {Joint training framework for text-to-speech and voice conversion using multi-source Tacotron and WaveNet},
author = {Mingyang Zhang and Xin Wang and Fuming Fang and Haizhou Li and Junichi Yamagishi},
journal= {arXiv preprint arXiv:1903.12389},
year = {2019}
}
备注
Submitted to Interspeech 2019, Graz, Austria