VAENAR-TTS:基于变分自编码器的非自回归文本到语音合成
声音
2021-07-08 v1 多媒体
音频与语音处理
摘要
本文描述了一种基于变分自编码器(VAE)的非自回归文本到语音(VAENAR-TTS)模型。基于序列到序列架构的自回归 TTS(AR-TTS)模型能够生成高质量语音,但其顺序解码过程可能耗时较长。近年来,非自回归 TTS(NAR-TTS)模型已被证明通过并行解码过程更为高效。然而,这些 NAR-TTS 模型依赖音素级时长来生成文本与频谱图之间的硬对齐。获取时长标签(无论是通过强制对齐还是知识蒸馏)都颇为繁琐。此外,基于音素扩展的硬对齐会降低合成语音的自然度。相比之下,所提出的 VAENAR-TTS 模型是一种端到端方法,不需要音素级时长。VAENAR-TTS 模型不包含循环结构,在训练与推理阶段均完全非自回归。基于 VAE 架构,对齐信息被编码于潜变量中,解码器中使用基于注意力的文本与潜变量之间的软对齐来重建频谱图。实验表明,VAENAR-TTS 达到了最先进的合成质量,同时合成速度与其它 NAR-TTS 模型相当。
引用
@article{arxiv.2107.03298,
title = {VAENAR-TTS: Variational Auto-Encoder based Non-AutoRegressive Text-to-Speech Synthesis},
author = {Hui Lu and Zhiyong Wu and Xixin Wu and Xu Li and Shiyin Kang and Xunying Liu and Helen Meng},
journal= {arXiv preprint arXiv:2107.03298},
year = {2021}
}