中文

使用深度生成混合网络和对抗对判别器的非平行情感转换

音频与语音处理 2020-08-12 v2 机器学习 声音

摘要

我们介绍了一种新颖的语音情感转换方法,该方法不需要平行训练数据。我们的方法松散地依赖于 cycle-GAN 架构,以最小化在情感对之间来回转换的重建误差。然而,与传统的 cycle-GAN 不同,我们的判别器分类一对输入的实样本和生成样本是否对应于期望的情感转换(例如,A 到 B)或其逆转换(B 到 A)。我们将证明,这种我们称之为变分 cycle-GAN (VC-GAN) 的设置,等价于最小化源特征与其循环对应特征之间的经验 KL 散度。此外,我们的生成器结合了一个可训练的深度网络和一个固定的生成模块,以对输入特征(在我们的案例中为基频 (F0) 轮廓)实施平滑且可逆的变换。这种混合架构规范了我们的对抗训练过程。我们使用众包来评估合成语音的情感显著性和质量。最后,我们通过修改由 Wavenet 生成的语音,展示了我们的模型能够泛化到新的说话人。

关键词

引用

@article{arxiv.2007.12932,
  title  = {Non-parallel Emotion Conversion using a Deep-Generative Hybrid Network and an Adversarial Pair Discriminator},
  author = {Ravi Shankar and Jacob Sager and Archana Venkataraman},
  journal= {arXiv preprint arXiv:2007.12932},
  year   = {2020}
}

备注

Paper accepted in Interspeech 2020