REF-VC:基于扩散转换器的稳健、表达且零样本语音转换
音频与语音处理
2025-08-11 v2
摘要
在实际的语音转换应用中,源语音中的环境噪声以及用户对表达输出的需求构成了关键挑战。传统的基于ASR的方法能够确保噪声鲁棒性,但会抑制语调丰富性;而基于SSL的方法提高了表达性,但受制于声纹泄漏和噪声敏感性。为此,本文提出了REF-VC,一个面向噪声鲁棒且具表达性的语音转换系统。关键创新包括:(1) 一种随机擦除策略来缓解SSL特征中固有的冗余信息,从而增强噪声鲁棒性和表达性;(2) 受E2TTS启发的隐式对齐,以抑制非本质特征的重建;(3) 集成Shortcut模型以加速流匹配推理,将步骤显著减少到4步。实验结果表明,REF-VC在零样本场景下在噪声数据集上超越了诸如Seed-VC等基线方法,而在干净数据集上则与Seed-VC相当。此外,REF-VC可以与歌声转换兼容。
引用
@article{arxiv.2508.04996,
title = {REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers},
author = {Yuepeng Jiang and Ziqian Ning and Shuai Wang and Chengjia Wang and Mengxiao Bi and Pengcheng Zhu and Zhonghua Fu and Lei Xie},
journal= {arXiv preprint arXiv:2508.04996},
year = {2025}
}