Poly-SVC:基于和声建模的多音 aware 歌声转换
声音
2026-05-13 v1
摘要
歌声转换(SVC)旨在将源歌声转换为目标歌手的声线,同时保留歌词与旋律。大多数现有SVC方法依赖F0提取器从干净人声中捕获主旋律。然而,目前尚无方法能可靠地从伴奏录音中提取干净人声而不留下残余和声。本文创新性地提出Poly-SVC,一个零样本、跨语言的歌声转换系统,用于处理残余和声。Poly-SVC由三个关键组件构成:基于Constant-Q Transform(CQT)的音高提取器,用于保留主旋律和残余和声;随机采样器以减少CQT中的干扰信息;基于条件流匹配(CFM)的扩散解码器,将音高、内容和 timbre 特征融合生成自然的多音输出。实验表明,Poly-SVC在自然度、声纹相似性和和声重建方面均优于基线模型,无论是和声丰富还是单旋律录音。
引用
@article{arxiv.2605.12310,
title = {Poly-SVC: Polyphony-Aware Singing Voice Conversion with Harmonic Modeling},
author = {Chen Geng and Meng Chen and Ruohua Zhou and Ruolan Liu and Weifeng Zhao},
journal= {arXiv preprint arXiv:2605.12310},
year = {2026}
}
备注
Accepted by ICASSP 2026