中文

DiffSVC:一种用于歌声转换的扩散概率模型

音频与语音处理 2021-05-31 v1 计算与语言 声音

摘要

歌声转换(SVC)是一项有前景的技术,它通过赋予计算机生成高保真且富有表现力的歌声的能力,丰富了人机交互的方式。本文中,我们提出DiffSVC,一种基于去噪扩散概率模型的SVC系统。DiffSVC使用音素后验图(PPGs)作为内容特征。DiffSVC中训练了一个去噪模块,该模块以扩散/前向过程产生的被破坏梅尔频谱图及其对应步数信息作为输入,预测所加入的高斯噪声。我们使用PPGs、基频特征与响度特征作为辅助输入以协助去噪过程。实验表明,DiffSVC在自然度与音色相似度方面相较当前最先进的SVC方法能取得更优的转换性能。

关键词

引用

@article{arxiv.2105.13871,
  title  = {DiffSVC: A Diffusion Probabilistic Model for Singing Voice Conversion},
  author = {Songxiang Liu and Yuewen Cao and Dan Su and Helen Meng},
  journal= {arXiv preprint arXiv:2105.13871},
  year   = {2021}
}

备注

Preprint. 8 pages, 2 figures and 1 table