中文

基于生成对抗网络的统计参数语音合成声门波形模型

音频与语音处理 2019-03-15 v1 计算与语言 机器学习 声音

摘要

近期研究表明,使用声门声码器可改善文本到语音的合成质量。这指的是将语音参数化为声门激励和声道两部分,二者发生于人类语音产生器官中。当前的声门声码器通过使用深度神经网络(DNNs)生成声门激励波形。然而,现有声门激励模型基于平方误差的训练仅限于生成条件平均波形,无法捕捉波形的随机变化。因此,需添加整形噪声作为后处理。在本研究中,我们提出一种利用生成对抗网络(GANs)预测声门波形的新方法。GANs是旨在将数据分布嵌入潜空间中的生成模型,能够通过随机采样潜分布生成与原始数据非常相似的新样本。GANs生成的声门脉冲显示出与自然声门脉冲相似的随机分量。在我们的实验中,我们比较了使用DNNs和GANs产生的声门波形所合成的语音。结果表明,新提出的GANs在不使用加性噪声分量的情况下,达到了与广泛使用的DNNs相当的合质量。

关键词

引用

@article{arxiv.1903.05955,
  title  = {Generative adversarial network-based glottal waveform model for statistical parametric speech synthesis},
  author = {Bajibabu Bollepalli and Lauri Juvela and Paavo Alku},
  journal= {arXiv preprint arXiv:1903.05955},
  year   = {2019}
}

备注

Accepted in Interspeech