SYKI-SVC:通过后处理创新和开源专业测试集推进歌声转换
声音
2025-01-07 v1 音频与语音处理
摘要
歌声转换旨在将源歌声转换为目标歌手的歌声,同时保留原始歌词、旋律和各种声乐技巧。本文提出了一种高保真歌声转换系统。我们的系统基于SVCC T02框架,包含三个关键组件:特征提取器、语音转换器和后处理器。特征提取器利用ContentVec和Whisper模型从输入歌声中提取F0轮廓和与说话者无关的语言特征。然后,语音转换器整合提取的音色、F0和语言内容,合成目标说话者的波形。后处理器通过简单有效的信号处理直接从源信号增强高频信息,以提升音频质量。由于缺乏用于评估表现力歌声转换系统的标准化专业数据集,我们创建并公开了一个专用测试集。比较评估表明,我们的系统达到了非常高的自然度水平,进一步分析证实了我们所提出的系统设计的有效性。
引用
@article{arxiv.2501.02953,
title = {SYKI-SVC: Advancing Singing Voice Conversion with Post-Processing Innovations and an Open-Source Professional Testset},
author = {Yiquan Zhou and Wenyu Wang and Hongwu Ding and Jiacheng Xu and Jihua Zhu and Xin Gao and Shihao Li},
journal= {arXiv preprint arXiv:2501.02953},
year = {2025}
}
备注
Accepted by ICASSP 2025