中文

Parallel Tacotron 2:一种具有可微时长建模的非自回归神经语音合成模型

声音 2021-08-31 v7 音频与语音处理

摘要

本文介绍 Parallel Tacotron 2,一种具有完全可微时长模型的非自回归神经文本转语音(text-to-speech, TTS)模型,该时长模型不需要有监督的时长信号。该时长模型基于一种新颖的注意力机制以及基于软动态时间规整(Soft Dynamic Time Warping)的迭代重构损失,能够自动学习词元-帧对齐以及词元时长。实验结果表明,在多个不同的多说话人评测中,Parallel Tacotron 2 在主观自然度上优于基线模型。其时长控制能力也得到了展示。

关键词

引用

@article{arxiv.2103.14574,
  title  = {Parallel Tacotron 2: A Non-Autoregressive Neural TTS Model with Differentiable Duration Modeling},
  author = {Isaac Elias and Heiga Zen and Jonathan Shen and Yu Zhang and Ye Jia and RJ Skerry-Ryan and Yonghui Wu},
  journal= {arXiv preprint arXiv:2103.14574},
  year   = {2021}
}

备注

Submitted to INTERSPEECH 2021