中文

LatentVoiceGrad:基于潜在扩散/流匹配模型的非平行语音转换

声音 2025-09-11 v1 音频与语音处理

摘要

之前,我们提出了 VoiceGrad,这是一种非平行语音转换(VC)技术,能够使用基于得分的扩散模型将源语音的梅尔频谱图转换为目标说话人的梅尔频谱图。该方法的核心是训练一个预测来自不同说话人梅尔频谱图对数密度梯度的得分网络。通过迭代调整输入梅尔频谱图,使其逐渐接近目标说话人的特征来实现语音转换。然而,仍存在两个挑战:音频质量有待提升,转换速度不如现代高速VC方法。为此,我们引入潜在扩散模型到 VoiceGrad 中,提出一种在自编码器瓶颈中进行逆扩散的改进版本。此外,我们提出使用流匹配模型作为扩散模型的替代方案,以进一步加速转换过程而不牺牲转换质量。实验结果表明,相较于原始方法,改进版语音质量得到提升,转换速度也得到加快。

关键词

引用

@article{arxiv.2509.08379,
  title  = {LatentVoiceGrad: Nonparallel Voice Conversion with Latent Diffusion/Flow-Matching Models},
  author = {Hirokazu Kameoka and Takuhiro Kaneko and Kou Tanaka and Yuto Kondo},
  journal= {arXiv preprint arXiv:2509.08379},
  year   = {2025}
}

备注

Submitted to IEEE-TASLP