中文

基于多源 Tacotron 与 WaveNet 的语音合成与语音转换联合训练框架

音频与语音处理 2019-04-09 v2 计算与语言 声音 机器学习

摘要

我们研究了针对语音合成(TTS)与语音转换(VC)任务训练共享模型的方法。我们提出采用 Tacotron 的扩展模型架构,即具有双注意力机制的多源序列到序列模型,作为 TTS 与 VC 任务的共享模型。该模型可根据输入类型分别完成这两项不同任务。当模型以文本作为输入时进行端到端语音合成任务,而当以源说话人语音作为输入时进行序列到序列语音转换任务。波形信号由 WaveNet 生成,其以预测的梅尔谱图为条件。我们提出联合训练一个作为目标说话人解码器、支持多源的共享模型。听感实验表明,我们提出的多源编码器-解码器模型能高效实现 TTS 与 VC 两项任务。

关键词

引用

@article{arxiv.1903.12389,
  title  = {Joint training framework for text-to-speech and voice conversion using multi-source Tacotron and WaveNet},
  author = {Mingyang Zhang and Xin Wang and Fuming Fang and Haizhou Li and Junichi Yamagishi},
  journal= {arXiv preprint arXiv:1903.12389},
  year   = {2019}
}

备注

Submitted to Interspeech 2019, Graz, Austria