SC-GlowTTS:一种高效的零样本多说话人文本转语音模型
音频与语音处理
2021-06-17 v2 声音
摘要
在本文中,我们提出 SC-GlowTTS:一种高效的零样本多说话人文本转语音模型,可改善训练期间未见过说话人的相似度。我们提出了一种说话人条件架构,其探索了一种在零样本场景下工作的基于流的 decoder。作为文本编码器,我们探索了基于扩张残差卷积的编码器、基于门控卷积的编码器和基于 Transformer 的编码器。此外,我们已经表明,在训练数据集上针对 TTS 模型预测出的谱图调整基于 GAN 的声码器,可以显著提升新说话人的相似度和语音质量。我们的模型仅使用 11 个说话人即可收敛,在新说话人相似度上达到 SOTA 结果,并具备高语音质量。
引用
@article{arxiv.2104.05557,
title = {SC-GlowTTS: an Efficient Zero-Shot Multi-Speaker Text-To-Speech Model},
author = {Edresson Casanova and Christopher Shulby and Eren Gölge and Nicolas Michael Müller and Frederico Santos de Oliveira and Arnaldo Candido Junior and Anderson da Silva Soares and Sandra Maria Aluisio and Moacir Antonelli Ponti},
journal= {arXiv preprint arXiv:2104.05557},
year = {2021}
}
备注
Accepted on Interspeech 2021