FasterVoiceGrad:基于对抗扩散转换蒸馏的快速一步扩散语音转换模型
声音
2025-08-26 v1 人工智能
机器学习
音频与语音处理
机器学习
摘要
扩散-based语音转换(VC)模型(如VoiceGrad)能够实现高质量的语音和说话人相似性,但其转换过程因迭代采样而较慢。FastVoiceGrad通过蒸馏VoiceGrad为一个一步扩散模型来克服这一限制,但仍需要计算密集型的内容编码器来分离说话人的身份和内容,从而减慢转换速度。因此,我们提出了FasterVoiceGrad,这是一个通过对抗扩散转换蒸馏(ADCD)同时蒸馏扩散模型和内容编码器获得的新型一步扩散VC模型,其中在转换过程中进行蒸馏,并利用对抗和评分蒸馏训练。实验评估表明,FasterVoiceGrad在一个-shot VC中实现了与FastVoiceGrad相当的VC性能,GPU和CPU上的速度分别快6.6-6.9倍和1.8倍。
引用
@article{arxiv.2508.17868,
title = {FasterVoiceGrad: Faster One-step Diffusion-Based Voice Conversion with Adversarial Diffusion Conversion Distillation},
author = {Takuhiro Kaneko and Hirokazu Kameoka and Kou Tanaka and Yuto Kondo},
journal= {arXiv preprint arXiv:2508.17868},
year = {2025}
}
备注
Accepted to Interspeech 2025. Project page: https://www.kecl.ntt.co.jp/people/kaneko.takuhiro/projects/fastervoicegrad/