中文

解耦风格与说话人属性用于 TTS 风格迁移

声音 2022-01-25 v1 音频与语音处理

摘要

端到端神经 TTS 在语音风格迁移中已展现出改进的性能。然而,该改进仍受限于目标风格与说话人可用训练数据的不足。此外,当训练好的 TTS 试图将语音从具有未知任意风格的新说话人迁移到目标风格时,观察到性能退化。本文中,我们提出一种在 disjoint 多风格数据集上进行的可见与不可见风格迁移训练新方法,即不同风格的数据集由不同说话人录制,每个说话人以多句话语录制一种单独风格。首先引入逆自回归流(IAF)技术以改进用于学习富有表现力风格表示的变分推断。随后开发说话人编码器网络以学习判别性说话人嵌入,其与其余神经 TTS 模块联合训练。所提的可见与不可见风格迁移方法通过六个专门设计的目标有效训练:重构损失、对抗损失、风格失真损失、循环一致性损失、风格分类损失与说话人分类损失。实验从客观与主观上证明了所提方法对可见与不可见风格迁移任务的有效性。我们的方法性能优于且比先前四种其他参考系统更鲁棒。

关键词

引用

@article{arxiv.2201.09472,
  title  = {Disentangling Style and Speaker Attributes for TTS Style Transfer},
  author = {Xiaochun An and Frank K. Soong and Lei Xie},
  journal= {arXiv preprint arXiv:2201.09472},
  year   = {2022}
}