Parallel Tacotron 2:一种具有可微时长建模的非自回归神经语音合成模型
声音
2021-08-31 v7 音频与语音处理
摘要
本文介绍 Parallel Tacotron 2,一种具有完全可微时长模型的非自回归神经文本转语音(text-to-speech, TTS)模型,该时长模型不需要有监督的时长信号。该时长模型基于一种新颖的注意力机制以及基于软动态时间规整(Soft Dynamic Time Warping)的迭代重构损失,能够自动学习词元-帧对齐以及词元时长。实验结果表明,在多个不同的多说话人评测中,Parallel Tacotron 2 在主观自然度上优于基线模型。其时长控制能力也得到了展示。
引用
@article{arxiv.2103.14574,
title = {Parallel Tacotron 2: A Non-Autoregressive Neural TTS Model with Differentiable Duration Modeling},
author = {Isaac Elias and Heiga Zen and Jonathan Shen and Yu Zhang and Ye Jia and RJ Skerry-Ryan and Yonghui Wu},
journal= {arXiv preprint arXiv:2103.14574},
year = {2021}
}
备注
Submitted to INTERSPEECH 2021