StyleTTS-VC:通过基于风格的 TTS 模型知识迁移实现一次语音转换
音频与语音处理
2023-01-02 v1 声音
摘要
一次语音转换(VC)旨在将任意源说话人的语音转换为任意目标说话人,仅使用目标说话人几秒的参考语音。这在很大程度上依赖于解耦说话人身份与语音内容,而该任务仍具挑战性。在此,我们提出一种通过从基于风格的文本到语音(TTS)模型迁移学习来解耦语音表示的新方法。借助循环一致与对抗训练,基于风格的 TTS 模型能以高保真度和相似度执行转录引导的一次 VC。通过学习一个额外的 mel 谱图编码器,经由师生知识迁移和新颖的数据增强方案,我们的方法无需输入文本即可得到解耦的语音表示。主观评价表明,我们的方法在自然度和相似度上均显著优于先前最先进的一次语音转换模型。
引用
@article{arxiv.2212.14227,
title = {StyleTTS-VC: One-Shot Voice Conversion by Knowledge Transfer from Style-Based TTS Models},
author = {Yinghao Aaron Li and Cong Han and Nima Mesgarani},
journal= {arXiv preprint arXiv:2212.14227},
year = {2023}
}
备注
SLT 2022