SPA-SVC: 面向歌声转换的自监督音高增强
声音
2024-06-12 v1 人工智能
音频与语音处理
摘要
基于扩散的歌声转换(SVC)模型相比传统方法展现出更好的合成质量。然而,在跨域SVC场景中,当源语音域和目标语音域之间存在显著音高差异时,模型倾向于生成带有嘶哑声的音频,这给实现高质量声音输出带来了挑战。因此,在本文中,我们提出了一种用于歌声转换的自监督音高增强方法(SPA-SVC),它可以在不需要额外数据或增加模型参数的情况下增强SVC任务中的语音质量。我们创新性地将循环音高偏移训练策略和结构相似性指数(SSIM)损失引入到我们的SVC模型中,有效提升了其性能。在公共歌唱数据集M4Singer上的实验结果表明,我们提出的方法在一般SVC场景以及特别是跨域SVC场景中显著提升了模型性能。
引用
@article{arxiv.2406.05692,
title = {SPA-SVC: Self-supervised Pitch Augmentation for Singing Voice Conversion},
author = {Bingsong Bai and Fengping Wang and Yingming Gao and Ya Li},
journal= {arXiv preprint arXiv:2406.05692},
year = {2024}
}
备注
Accepted by Interspeech 2024