基于 VITS 并利用 Whisper 与多尺度 F0 建模的歌声转换
音频与语音处理
2023-10-05 v1
摘要
本文介绍了 T23 团队提交给 2023 年歌声转换挑战赛的系统。遵循识别-合成框架,我们的歌声转换模型基于 VITS,包含四个关键模块:先验编码器、后验编码器、解码器以及并行转置卷积库(PBTC)模块。我们特别利用强大的预训练 ASR 模型 Whisper 提取瓶颈特征(BNF)作为先验编码器的输入。在 BNF 提取之前,我们对源信号进行音高扰动以去除说话人音色,从而有效避免源说话人音色泄漏到目标中。此外,PBTC 模块提取多尺度 F0 作为先验编码器的辅助输入,从而更好地捕捉歌唱中的音高变化。我们设计了一种三阶段训练策略,以在目标说话人数据有限的情况下使基础模型更好地适配目标说话人。官方挑战赛结果表明,我们的系统在自然度方面表现优越,在任务 1 和任务 2 中分别排名第 1 和第 2。进一步的消融实验验证了我们的系统设计的有效性。
引用
@article{arxiv.2310.02802,
title = {VITS-Based Singing Voice Conversion Leveraging Whisper and multi-scale F0 Modeling},
author = {Ziqian Ning and Yuepeng Jiang and Zhichao Wang and Bin Zhang and Lei Xie},
journal= {arXiv preprint arXiv:2310.02802},
year = {2023}
}