HQ-SVC:面向低资源场景的高质量零样本歌声转换
声音
2025-11-18 v3 人工智能
音频与语音处理
摘要
零样本歌声转换(SVC)将源歌手的音色转换为未见过的目标说话人的声音,同时无需微调即可保留旋律内容。现有方法将说话人音色和声乐内容分开建模,丢失了导致输出质量下降的必要声学信息,同时需要大量计算资源。为了克服这些局限性,我们提出了 HQ-SVC,这是一个用于高质量零样本 SVC 的高效框架。HQ-SVC 首先使用解耦编解码器联合提取内容和说话人特征。然后通过音高和音量建模增强保真度,保留了在分离建模方法中通常会丢失的关键声学信息,并通过可微信号处理和扩散技术逐步优化输出。评估证实,HQ-SVC 在转换质量和效率上显著优于最先进的零样本 SVC 方法。除了声音转换之外,与专门的音频超分辨率方法相比,HQ-SVC 在原生支持语音超分辨率任务的同时,实现了更优的语音自然度。
引用
@article{arxiv.2511.08496,
title = {HQ-SVC: Towards High-Quality Zero-Shot Singing Voice Conversion in Low-Resource Scenarios},
author = {Bingsong Bai and Yizhong Geng and Fengping Wang and Cong Wang and Puyuan Guo and Yingming Gao and Ya Li},
journal= {arXiv preprint arXiv:2511.08496},
year = {2025}
}
备注
Accepted by AAAI 2026 main technical track