利用长文本内容与多说话人多风格建模提升神经语音合成质量
音频与语音处理
2023-06-29 v2
摘要
若有足量高质量语音材料用于训练,神经文本转语音(TTS)可提供接近自然语音的质量。然而,获取 TTS 训练语音数据成本高且耗时,尤其在需生成不同说话风格时。本工作中,我们表明除常规 TTS 录音外,通过使用长文本录音训练多说话人多风格(MSMS)模型,可实现跨说话人的风格迁移并提升合成语音质量。具体而言,我们表明:1)多说话人建模提升了整体 TTS 质量;2)在利用额外多说话人数据时,所提 MSMS 方法优于预训练与微调方法;3)无论目标文本领域如何,长文本说话风格均获高评价。
引用
@article{arxiv.2212.10075,
title = {Improving the quality of neural TTS using long-form content and multi-speaker multi-style modeling},
author = {Tuomo Raitio and Javier Latorre and Andrea Davis and Tuuli Morrill and Ladan Golipour},
journal= {arXiv preprint arXiv:2212.10075},
year = {2023}
}
备注
Accepted to 12th ISCA Speech Synthesis Workshop (SSW)