中文

具有时频一致性的无监督跨域语音到语音转换

音频与语音处理 2020-05-20 v2 机器学习 声音

摘要

近年来,基于生成对抗网络(generative adversarial network, GAN)的模型已成功应用于无监督语音到语音转换。幅度谱图的丰富紧凑谐波视图被认为是用音频数据训练这些模型的合适选择。为了重建语音信号,首先由神经网络生成幅度谱图,然后利用Griffin-Lim算法等方法重建相位谱图。这一过程存在的问题是,生成的幅度谱图可能不一致,而这是找到相位以使完整谱图具有自然听感语音波形所必需的。在这项工作中,我们通过在对抗训练过程中引入鼓励谱图一致性的条件来解决此问题。我们在将男性说话人声音转换为女性说话人声音及反之亦然的任务上展示了我们的方法。我们在Librispeech语料库上的实验结果表明,用TF一致性训练的模型提供了感知上更优的语音到语音转换质量。

关键词

引用

@article{arxiv.2005.07810,
  title  = {Unsupervised Cross-Domain Speech-to-Speech Conversion with Time-Frequency Consistency},
  author = {Mohammad Asif Khan and Fabien Cardinaux and Stefan Uhlich and Marc Ferras and Asja Fischer},
  journal= {arXiv preprint arXiv:2005.07810},
  year   = {2020}
}