用于去噪扩散TTS模型的零样本语音条件化
声音
2022-06-23 v2 人工智能
机器学习
音频与语音处理
信号处理
摘要
我们提出了一种新颖的方法,将预训练的去噪扩散语音模型条件化,以生成训练期间未见过的新人物的语音。该方法需要来自目标人物的短(约3秒)样本,并在推理时引导生成,无需任何训练步骤。该方法的核心在于一种采样过程,其将去噪模型的估计与目标说话人样本的低通版本相结合。客观与主观评估表明,我们的采样方法能在频率方面生成与目标说话人相似的语音,准确度可与最先进方法媲美,且无需训练。
引用
@article{arxiv.2206.02246,
title = {Zero-Shot Voice Conditioning for Denoising Diffusion TTS Models},
author = {Alon Levkovitch and Eliya Nachmani and Lior Wolf},
journal= {arXiv preprint arXiv:2206.02246},
year = {2022}
}
备注
Accepted to Interspeech 2022