中文

CoDiff-VC:一种基于编解码器辅助扩散模型的零样态语音转换方法

声音 2024-12-04 v3 音频与语音处理

摘要

零样态语音转换(VC)旨在将原始说话者的音色转换为任意目标说话者,同时保持语言内容。当前主流的零样态语音转换方法依赖预训练的识别模型来解耦语言内容和说话者表示。这导致解耦后的语言内容中残留音色,并在说话者表示建模方面存在不足。本文提出CoDiff-VC,一个用于零样态语音转换的端到端框架,将语音编解码器和扩散模型集成以生成高保真波形。我们的方法采用单码本编解码器分离源语音的语言内容。为增强内容解耦,我们引入Mix-Style层归一化(MSLN)以扰动原始音色。此外,我们采用多尺度说话者音色建模方法以确保音色一致性并提高语音细节相似度。为提高语音质量和说话者相似度,我们引入双分类器自由指导,提供生成过程中的内容和音色指导。客观和主观实验表明,CoDiff-VC显著提升了说话者相似度,生成自然且更高质量的语音。

关键词

引用

@article{arxiv.2411.18918,
  title  = {CoDiff-VC: A Codec-Assisted Diffusion Model for Zero-shot Voice Conversion},
  author = {Yuke Li and Xinfa Zhu and Hanzhao Li and JiXun Yao and WenJie Tian and XiPeng Yang and YunLin Chen and Zhifei Li and Lei Xie},
  journal= {arXiv preprint arXiv:2411.18918},
  year   = {2024}
}