ZSVC:基于解耦潜空间扩散模型与对抗训练的零样本风格语音转换
音频与语音处理
2025-01-09 v1 声音
摘要
风格语音转换旨在将源语音的说话风格转换为期望的风格,同时保持原始说话人的身份。然而,以往的风格语音转换方法主要聚焦于情感等方面这类定义明确的领域,限制了其实际应用。在本研究中,我们提出了 ZSVC,一种新颖的零样本风格语音转换方法,它利用语音编解码器与带有语音提示机制的潜空间扩散模型,以促进用于说话风格转换的上下文学习。为了解耦说话风格与说话人音色,我们引入信息瓶颈来过滤源语音中的说话风格,并采用不确定性建模自适应实例归一化(UMAdaIN)来扰动风格提示中的说话人音色。此外,我们提出了一种新颖的对抗训练策略,以增强上下文学习并提升风格相似度。在 44,000 小时语音数据上进行的实验表明,ZSVC 在零样本场景下生成具有多样化说话风格的语音方面具有卓越性能。
引用
@article{arxiv.2501.04416,
title = {ZSVC: Zero-shot Style Voice Conversion with Disentangled Latent Diffusion Models and Adversarial Training},
author = {Xinfa Zhu and Lei He and Yujia Xiao and Xi Wang and Xu Tan and Sheng Zhao and Lei Xie},
journal= {arXiv preprint arXiv:2501.04416},
year = {2025}
}
备注
5 pages, 3 figures, accepted by ICASSP 2025