非自回归神经文本到语音合成
计算与语言
2020-07-01 v3 机器学习
声音
音频与语音处理
摘要
在本工作中,我们提出 ParaNet,一种将文本转换为频谱图的非自回归 seq2seq 模型。它完全基于卷积,在合成时相比轻量级 Deep Voice 3 实现了 46.7 倍加速,同时获得合理良好的语音质量。ParaNet 还通过以逐层方式迭代改进注意力,在具有挑战性的测试句上产生文本与语音间的稳定对齐。此外,我们构建了并行文本到语音系统并测试了多种并行神经声码器,可通过单次前馈传递从文本合成语音。我们还探索了一种基于 VAE 的新方法来从头训练基于逆自回归流(IAF)的并行声码器,避免了以往工作需从单独训练的 WaveNet 蒸馏的需求。
引用
@article{arxiv.1905.08459,
title = {Non-Autoregressive Neural Text-to-Speech},
author = {Kainan Peng and Wei Ping and Zhao Song and Kexin Zhao},
journal= {arXiv preprint arXiv:1905.08459},
year = {2020}
}
备注
Published at ICML 2020. (v3 changed paper title)