中文

LDM-SVC:基于潜在扩散模型的零样本任意到任意歌声转换与歌手引导

音频与语音处理 2024-06-11 v1 声音

摘要

任意到任意歌声转换(SVC)是一种有趣的音频编辑技术,旨在将一位歌手的歌声转换为另一位歌手的歌声,仅需几秒钟的歌声数据。然而,在转换过程中,音色泄露问题不可避免:转换后的歌声听起来仍然像原始歌手的声音。为了解决这个问题,本文提出了一种用于SVC的潜在扩散模型(LDM-SVC),该模型尝试使用LDM在潜在空间中进行SVC。我们利用基于VITS框架的著名开源项目So-VITS-SVC预训练了一个变分自编码器结构,然后将其用于LDM训练。此外,我们提出了一种基于无分类器引导的歌手引导训练方法,以进一步抑制原始歌手的音色。实验结果表明,在音色相似度的主观和客观评估中,所提方法均优于先前的工作。

关键词

引用

@article{arxiv.2406.05325,
  title  = {LDM-SVC: Latent Diffusion Model Based Zero-Shot Any-to-Any Singing Voice Conversion with Singer Guidance},
  author = {Shihao Chen and Yu Gu and Jie Zhang and Na Li and Rilin Chen and Liping Chen and Lirong Dai},
  journal= {arXiv preprint arXiv:2406.05325},
  year   = {2024}
}

备注

Accepted by Interspeech 2024