Guided-TTS 2:一种利用无转录数据实现高质量自适应文本转语音的扩散模型
声音
2022-06-01 v1 人工智能
音频与语音处理
摘要
我们提出 Guided-TTS 2,一种基于扩散的生成模型,利用无转录数据实现高质量自适应 TTS。Guided-TTS 2 将说话人条件扩散模型与说话人相关的音素分类器相结合以实现自适应文本转语音。我们在大规模无转录数据集上训练说话人条件扩散模型以用于无分类器引导方法,并进一步在目标说话人的参考语音上微调该扩散模型以实现自适应,这仅需 40 秒。我们证明,Guided-TTS 2 仅使用十秒无转录数据,在语音质量和说话人相似度方面就展现出与高质量单说话人 TTS 基线相当的性能。我们进一步表明,即使在零样本自适应设置下,Guided-TTS 2 在多说话人数据集上也优于自适应 TTS 基线。Guided-TTS 2 仅使用无转录语音即可适应广泛的嗓音,从而实现使用非人类角色(如《指环王》中的咕噜)嗓音的自适应 TTS。
引用
@article{arxiv.2205.15370,
title = {Guided-TTS 2: A Diffusion Model for High-quality Adaptive Text-to-Speech with Untranscribed Data},
author = {Sungwon Kim and Heeseung Kim and Sungroh Yoon},
journal= {arXiv preprint arXiv:2205.15370},
year = {2022}
}