建模多说话人潜空间以改进神经 TTS:快速注册新说话人与增强优质音色
音频与语音处理
2019-09-04 v4 计算与语言
声音
摘要
神经 TTS 已展现出其能够生成高质量的合成语音。本文中,我们研究多说话人潜空间以改进神经 TTS,使系统仅利用几分钟语音即可适配新说话人,或通过利用其他说话人的数据以获得更丰富的上下文覆盖和更好的泛化能力来增强优质音色。我们构建了一个多说话人神经 TTS 模型,在频谱与说话人潜空间中均嵌入了说话人信息。实验结果表明,利用来自新说话人少于 5 分钟的训练数据,新模型在自然度上可达到 4.16 的 MOS 分数,在说话人相似度上达到 4.64,接近人类录音(4.74)。对于训练良好的优质音色,我们在域外文本上可达到 4.5 的 MOS 分数,与专业录音的 4.58 相当,且显著优于单说话人结果的 4.28。
引用
@article{arxiv.1812.05253,
title = {Modeling Multi-speaker Latent Space to Improve Neural TTS: Quick Enrolling New Speaker and Enhancing Premium Voice},
author = {Yan Deng and Lei He and Frank Soong},
journal= {arXiv preprint arXiv:1812.05253},
year = {2019}
}