用于非自回归语音合成的交叉语句条件变分自编码器
声音
2022-05-10 v1 计算与语言
音频与语音处理
摘要
在端到端文本到语音(TTS)系统中,对韵律变化建模对于合成自然且富有表现力的语音至关重要。本文提出一种交叉语句条件 VAE(CUC-VAE),通过以从前后句子获取的声学特征、说话人信息和文本特征为条件,估计每个音素的潜在韵律特征的后验概率分布。在推理时,CUC-VAE 允许从以交叉语句信息为条件的语句特定先验分布中采样,而非 VAE 所用的标准高斯分布,这使得 TTS 系统生成的韵律特征与上下文相关,且更类似于人类自然产生韵律的方式。CUC-VAE 的性能通过针对自然度、可懂度的定性听测以及包括词错误率和韵律属性标准差在内的定量测量进行评估。在 LJ-Speech 和 LibriTTS 数据上的实验结果表明,所提出的 CUC-VAE TTS 系统以明显优势提升了自然度与韵律多样性。
引用
@article{arxiv.2205.04120,
title = {Cross-Utterance Conditioned VAE for Non-Autoregressive Text-to-Speech},
author = {Yang Li and Cheng Yu and Guangzhi Sun and Hua Jiang and Fanglei Sun and Weiqin Zu and Ying Wen and Yang Yang and Jun Wang},
journal= {arXiv preprint arXiv:2205.04120},
year = {2022}
}
备注
ACL 2022 camera ready