中文

REF-VC:基于扩散转换器的稳健、表达且零样本语音转换

音频与语音处理 2025-08-11 v2

摘要

在实际的语音转换应用中,源语音中的环境噪声以及用户对表达输出的需求构成了关键挑战。传统的基于ASR的方法能够确保噪声鲁棒性,但会抑制语调丰富性;而基于SSL的方法提高了表达性,但受制于声纹泄漏和噪声敏感性。为此,本文提出了REF-VC,一个面向噪声鲁棒且具表达性的语音转换系统。关键创新包括:(1) 一种随机擦除策略来缓解SSL特征中固有的冗余信息,从而增强噪声鲁棒性和表达性;(2) 受E2TTS启发的隐式对齐,以抑制非本质特征的重建;(3) 集成Shortcut模型以加速流匹配推理,将步骤显著减少到4步。实验结果表明,REF-VC在零样本场景下在噪声数据集上超越了诸如Seed-VC等基线方法,而在干净数据集上则与Seed-VC相当。此外,REF-VC可以与歌声转换兼容。

关键词

引用

@article{arxiv.2508.04996,
  title  = {REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers},
  author = {Yuepeng Jiang and Ziqian Ning and Shuai Wang and Chengjia Wang and Mengxiao Bi and Pengcheng Zhu and Zhonghua Fu and Lei Xie},
  journal= {arXiv preprint arXiv:2508.04996},
  year   = {2025}
}