R2-SVC:面向实际场景的鲁健且富有表现力的零样本演唱语音转换
声音
2025-10-24 v1 人工智能
音频与语音处理
摘要
在实际演唱语音转换(SVC)应用中,环境噪声和对富有表现力输出的需求构成重要挑战。然而,传统方法通常不考虑实际部署场景,因为训练和推理都依赖干净数据。这种偏差使得实际应用受限,由于不可避免地存在多样化的噪声来源和来自音乐分离的伪影。为解决这些问题,我们提出了 R2-SVC,一个鲁健且富有表现力的 SVC 框架。首先,我们引入通过随机基频()扰动和音乐分离伪影模拟(如混响、回声)实现的仿真式鲁健性增强,显著提高了在噪声环境下的性能。其次,我们通过域特定演唱数据丰富说话人表征:除干净人声外,我们还整合了 DNSMOS 过滤后的分离人声和公共演唱语料库,使模型能够保持说话人声调的同时捕捉演唱风格的细微差别。最后,我们集成 Neural Source-Filter(NSF)模型,显式表示谐波和噪声分量,增强了转换演唱的自然度和可控性。R2-SVC 在多个 SVC 基准测试中实现了在干净和噪声条件下的领先成绩。
引用
@article{arxiv.2510.20677,
title = {R2-SVC: Towards Real-World Robust and Expressive Zero-shot Singing Voice Conversion},
author = {Junjie Zheng and Gongyu Chen and Chaofan Ding and Zihao Chen},
journal= {arXiv preprint arXiv:2510.20677},
year = {2025}
}
备注
5 pages, 2 figures