结合对抗学习的条件下变分自编码器端到端文本转语音
声音
2021-06-14 v1 音频与语音处理
摘要
近期已有若干支持单阶段训练与并行采样的端到端文本转语音(TTS)模型被提出,但其合成音质仍不及两阶段 TTS 系统。本文中,我们提出一种并行端到端 TTS 方法,可生成比当前两阶段模型更自然的音频。我们的方法采用由标准化流增强的变分推断与对抗训练过程,提升了生成建模的表达能力。我们还提出一种随机时长预测器,以从输入文本合成具有多样节奏的语音。通过对潜变量和随机时长预测器的不确定性建模,我们的方法表达了自然的一对多关系,即同一文本输入可以不同音高与节奏的多种方式说出。在单说话人数据集 LJ Speech 上的主观人工评测(平均意见分,即 MOS)表明,我们的方法优于最佳公开可用 TTS 系统,并取得了与真实语音相当的 MOS。
引用
@article{arxiv.2106.06103,
title = {Conditional Variational Autoencoder with Adversarial Learning for End-to-End Text-to-Speech},
author = {Jaehyeon Kim and Jungil Kong and Juhee Son},
journal= {arXiv preprint arXiv:2106.06103},
year = {2021}
}
备注
ICML 2021