中文

DDDM-VC:基于解耦表示与先验混合的解耦去噪扩散模型用于可验证鲁棒语音转换

音频与语音处理 2023-05-26 v1 人工智能 声音 信号处理

摘要

基于扩散的生成模型近年来展现出强大的生成性能。然而,由于数据分布中存在众多属性,且生成过程各层级共享模型参数存在若干局限,控制每个属性的特定风格仍具挑战。针对上述问题,本文提出具有解耦表示的解耦去噪扩散模型(DDDMs),可在生成模型中控制各属性的风格。我们将 DDDMs 应用于语音转换(VC)任务,以应对语音各属性(如语言信息、语调与音色)解耦与控制的挑战。首先,我们利用自监督表示解耦语音表示。随后,应用 DDDMs 从解耦表示中重新合成语音,以针对各属性进行去噪。此外,我们还提出用于鲁棒语音风格迁移的先验混合,其将混合风格的转换表示作为扩散模型的先验分布。实验结果表明,我们的方法优于公开可用的 VC 模型。进一步,我们展示了无论模型规模如何,我们的方法均能提供鲁棒的生成性能。音频样本见 https://hayeong0.github.io/DDDM-VC-demo/。

关键词

引用

@article{arxiv.2305.15816,
  title  = {DDDM-VC: Decoupled Denoising Diffusion Models with Disentangled Representation and Prior Mixup for Verified Robust Voice Conversion},
  author = {Ha-Yeong Choi and Sang-Hoon Lee and Seong-Whan Lee},
  journal= {arXiv preprint arXiv:2305.15816},
  year   = {2023}
}

备注

23 pages, 10 figures, 17 tables, under review