中文

利用长文本内容与多说话人多风格建模提升神经语音合成质量

音频与语音处理 2023-06-29 v2

摘要

若有足量高质量语音材料用于训练,神经文本转语音(TTS)可提供接近自然语音的质量。然而,获取 TTS 训练语音数据成本高且耗时,尤其在需生成不同说话风格时。本工作中,我们表明除常规 TTS 录音外,通过使用长文本录音训练多说话人多风格(MSMS)模型,可实现跨说话人的风格迁移并提升合成语音质量。具体而言,我们表明:1)多说话人建模提升了整体 TTS 质量;2)在利用额外多说话人数据时,所提 MSMS 方法优于预训练与微调方法;3)无论目标文本领域如何,长文本说话风格均获高评价。

关键词

引用

@article{arxiv.2212.10075,
  title  = {Improving the quality of neural TTS using long-form content and multi-speaker multi-style modeling},
  author = {Tuomo Raitio and Javier Latorre and Andrea Davis and Tuuli Morrill and Ladan Golipour},
  journal= {arXiv preprint arXiv:2212.10075},
  year   = {2023}
}

备注

Accepted to 12th ISCA Speech Synthesis Workshop (SSW)