中文

基于去噪扩散概率 GAN 模型的语音转换

声音 2023-08-29 v1 音频与语音处理

摘要

语音转换是一种能够在保持语言信息完整性的同时转换说话风格的方法。许多研究者使用深度生成模型进行语音转换任务。生成对抗网络(GANs)可以快速生成高质量样本,但生成样本缺乏多样性。去噪扩散概率模型(DDPMs)生成的样本在模式覆盖和样本多样性方面优于 GANs。但 DDPMs 计算成本高且推理速度慢于 GANs。为使 GANs 与 DDPMs 更实用,我们提出 DiffGAN-VC,一种 GANs 与 DDPMs 的变体,以实现非并行多对多语音转换(VC)。我们使用大步长实现去噪,并引入多模态条件 GANs 对去噪扩散生成对抗网络进行建模。根据客观与主观评测实验,DiffGAN-VC 在非并行数据集上实现了高语音质量。与 CycleGAN-VC 方法相比,DiffGAN-VC 在说话人相似度、自然度和更高音质方面更优。

关键词

引用

@article{arxiv.2308.14319,
  title  = {Voice Conversion with Denoising Diffusion Probabilistic GAN Models},
  author = {Xulong Zhang and Jianzong Wang and Ning Cheng and Jing Xiao},
  journal= {arXiv preprint arXiv:2308.14319},
  year   = {2023}
}

备注

Accepted by 19th International Conference on Advanced Data Mining and Applications. (ADMA 2023)