使用基于 VQ-VAE 的隐式时长进行端到端文本转语音
音频与语音处理
2020-10-21 v2 计算与语言
声音
摘要
显式时长建模是在文本转语音合成(TTS)中实现鲁棒且高效对齐的关键。我们提出一种使用显式时长建模的新 TTS 框架,将时长作为离散潜变量引入 TTS,并从零开始实现全体模块的联合优化。我们基于条件 VQ-VAE 形式化我们的方法以在变分自编码器中处理离散时长,并提供理论解释以论证我们的方法。在我们的框架中,基于连接主义时序分类(CTC)的强制对齐器充当近似后验,而文本到时长充当变分自编码器中的先验。我们通过听感测试评估所提方法,并将其与其他基于软注意力或显式时长建模的 TTS 方法比较。结果表明,我们的系统评分介于基于软注意力的方法(Transformer-TTS、Tacotron2)与基于显式时长建模的方法(Fastspeech)之间。
引用
@article{arxiv.2010.09602,
title = {End-to-End Text-to-Speech using Latent Duration based on VQ-VAE},
author = {Yusuke Yasuda and Xin Wang and Junichi Yamagishi},
journal= {arXiv preprint arXiv:2010.09602},
year = {2020}
}