中文

改进端到端神经 TTS 中已见与未见语音风格转换的性能

声音 2021-06-21 v1 音频与语音处理

摘要

端到端神经 TTS 训练在语音风格转换中已展现出改进的性能。然而,该改进仍受限于目标风格与说话人的训练数据。当训练好的 TTS 试图将语音从具有未知任意风格的新说话人转换到目标风格时,会出现风格转换性能不足的情况。在本文中,我们提出一种针对已见与未见风格的新风格转换方法,使用不相交的多风格数据集,即不同风格的数据集分别录制,每种个体风格由一名说话人发出多个语句。为编码风格信息,我们采用逆自回归流(IAF)结构来改进变分推断。整个系统被优化以最小化四个不同损失函数的加权和:1)重构损失,用于度量源与目标重构中的失真;2)对抗损失,用于“欺骗”训练良好的判别器;3)风格失真损失,用于度量转换后预期风格损失;4)循环一致性损失,用于在转换后保留源的说话人身份。实验从客观与主观两方面证明了所提方法在已见与未见风格转换任务上的有效性。新方法的性能优于先前技术的四个基线系统且更鲁棒。

关键词

引用

@article{arxiv.2106.10003,
  title  = {Improving Performance of Seen and Unseen Speech Style Transfer in End-to-end Neural TTS},
  author = {Xiaochun An and Frank K. Soong and Lei Xie},
  journal= {arXiv preprint arXiv:2106.10003},
  year   = {2021}
}