YingMusic-SVC:基于Flow-GRPO和演唱特定归纳偏置的实用稳健零样图书声音转换
声音
2025-12-05 v1 人工智能
摘要
声音转换(SVC)旨在呈现目标歌手的timbral同时保留旋律和歌词。然而,现有的零样SVC系统在实际歌曲中仍然脆弱,由于和声干扰、F0错误以及缺乏演唱相关的归纳偏置。我们提出YingMusic-SVC,一个稳健的零样框架,统一了连续预训练、稳健监督微调和Flow-GRPO强化学习。我们的模型引入了经过演唱训练的RVC时役移位器用于时役内容解耦,引入F0感知时役适配器用于动态声乐表达,并采用能量平衡的rectified flow匹配损失以增强高频保真度。在分级多轨基准上的实验表明,YingMusic-SVC在时役相似性、可理解性和感知自然度方面均优于强大的开源基线,尤其在伴奏和和声干扰条件下,显示出其在实际SVC部署中的有效性。
引用
@article{arxiv.2512.04793,
title = {YingMusic-SVC: Real-World Robust Zero-Shot Singing Voice Conversion with Flow-GRPO and Singing-Specific Inductive Biases},
author = {Gongyu Chen and Xiaoyu Zhang and Zhenqiang Weng and Junjie Zheng and Da Shen and Chaofan Ding and Wei-Qiang Zhang and Zihao Chen},
journal= {arXiv preprint arXiv:2512.04793},
year = {2025}
}
备注
17 pages, 5 figures