VoiceGrad:基于退火朗之万动力学的非并行任意到多语音转换
声音
2024-03-12 v3 音频与语音处理
摘要
在本文中,我们提出一种称为 VoiceGrad 的非并行任意到多语音转换(VC)方法。受近期引入的新型波形生成方法 WaveGrad 的启发,VoiceGrad 基于得分匹配与朗之万动力学的概念。它使用加权去噪得分匹配来训练一个得分近似器——一个具有 U-Net 结构、旨在预测多个说话人语音特征序列对数密度的梯度的全卷积网络,并通过使用退火朗之万动力学,基于训练好的得分近似器网络将输入特征序列迭代更新至目标分布的最近驻点来实现语音转换。得益于该概念的本质,VoiceGrad 支持任意到多 VC(一种输入语音说话人可为任意的 VC 场景),并允许非并行训练,无需平行语句或转写文本。
引用
@article{arxiv.2010.02977,
title = {VoiceGrad: Non-Parallel Any-to-Many Voice Conversion with Annealed Langevin Dynamics},
author = {Hirokazu Kameoka and Takuhiro Kaneko and Kou Tanaka and Nobukatsu Hojo and Shogo Seki},
journal= {arXiv preprint arXiv:2010.02977},
year = {2024}
}
备注
For more details on the baseline method used for comparison, please refer to our article in arXiv:2008.12604