中文

FastVoiceGrad:基于对抗条件扩散蒸馏的单步扩散语音转换

声音 2024-09-05 v1 人工智能 机器学习 音频与语音处理 机器学习

摘要

基于 VoiceGrad 等扩散语音转换(VC)技术引发广泛关注,因其在语音质量和说话人相似性方面表现卓越。然而,其显著局限是多步反向扩散导致推理速度慢。因此,我们提出 FastVoiceGrad,一种新型单步扩散 VC 方法,将迭代次数从数十次降至一次,同时保留多步扩散 VC 的高性能。我们采用对抗条件扩散蒸馏(ACDD)获取该模型,充分利用生成对抗网络和扩散模型的能力,并重新考虑采样中的初始状态。对 one-shot 任意到任意 VC 的评估表明,FastVoiceGrad 在 VC 性能上优于或相当于前述多步扩散 VC,同时显著提升推理速度。音频样本可在 https://www.kecl.ntt.co.jp/people/kaneko.takuhiro/projects/fastvoicegrad/ 查阅。

关键词

引用

@article{arxiv.2409.02245,
  title  = {FastVoiceGrad: One-step Diffusion-Based Voice Conversion with Adversarial Conditional Diffusion Distillation},
  author = {Takuhiro Kaneko and Hirokazu Kameoka and Kou Tanaka and Yuto Kondo},
  journal= {arXiv preprint arXiv:2409.02245},
  year   = {2024}
}

备注

Accepted to Interspeech 2024. Project page: https://www.kecl.ntt.co.jp/people/kaneko.takuhiro/projects/fastvoicegrad/