基于 VITS 的歌声转换系统结合 DSPGAN 后处理用于 SVCC2023
声音
2023-10-10 v1 音频与语音处理
摘要
本文介绍了 T02 团队针对 2023 年歌声转换挑战赛(SVCC2023)所提出的系统。我们的系统包含一个基于 VITS 的歌声转换(SVC)模型,集成了三个模块:特征提取器、声音转换器和后处理器。具体而言,特征提取器利用 HuBERT 模型从输入歌声中提供 F0 轮廓并提取说话人无关的语言内容。声音转换器用于重组说话人音色、F0 与语言内容,以生成目标说话人的波形。此外,为了进一步提升音频质量,引入了微调的 DSPGAN 声码器对波形进行重新合成。鉴于目标说话人数据有限,我们采用两阶段训练策略将基础模型适配至目标说话人。在模型适配过程中,运用了数据增强以及与辅助歌手数据联合训练等多种技巧。官方挑战赛结果表明,我们的系统取得了优异性能,尤其在跨域任务中,自然度与相似度分别排名第 1 和第 2。进一步的消融实验验证了系统设计的有效性。
引用
@article{arxiv.2310.05118,
title = {VITS-based Singing Voice Conversion System with DSPGAN post-processing for SVCC2023},
author = {Yiquan Zhou and Meng Chen and Yi Lei and Jihua Zhu and Weifeng Zhao},
journal= {arXiv preprint arXiv:2310.05118},
year = {2023}
}
备注
Accepted by ASRU2023