利用量化细粒度VAE与自回归韵律先验生成多样自然的文本转语音样本
音频与语音处理
2020-02-11 v1 机器学习
声音
机器学习
摘要
近期具有细粒度隐特征的神经文本转语音(TTS)模型能够精确控制合成语音的韵律。此类模型通常包含细粒度变分自编码器(VAE)结构,在每个输入词元(如音素)处提取隐特征。然而,使用标准VAE先验生成样本常导致不自然且不连续的语音,词元间韵律变化剧烈。本文提出一种离散隐空间中的序列先验,可生成听起来更自然的样本。这是通过向量量化(VQ)离散化隐特征,并单独在其上训练自回归(AR)先验模型来实现的。我们使用听感测试、自动语音识别(ASR)性能的客观指标以及韵律属性测量来评估该方法。实验结果表明,所提模型显著提升了随机样本生成的自然度。此外,初步实验表明,从所提模型随机采样可用作数据增强以改善ASR性能。
引用
@article{arxiv.2002.03788,
title = {Generating diverse and natural text-to-speech samples using a quantized fine-grained VAE and auto-regressive prosody prior},
author = {Guangzhi Sun and Yu Zhang and Ron J. Weiss and Yuan Cao and Heiga Zen and Andrew Rosenberg and Bhuvana Ramabhadran and Yonghui Wu},
journal= {arXiv preprint arXiv:2002.03788},
year = {2020}
}
备注
To appear in ICASSP 2020