中文

WaveCycleGAN2:用于语音波形生成的时域神经后滤波器

声音 2019-04-10 v2 机器学习 音频与语音处理 机器学习

摘要

WaveCycleGAN 近来被提出以弥合统计参数语音合成中自然与合成语音波形间的差距,并利用移动平均模型而非自回归模型提供快速推断,以及通过对抗训练提供高质量语音合成。然而,人耳仍可将处理后的语音波形与自然语音区分。造成此可区分性的一个可能原因是经下/上采样模块观察到的处理语音波形中的混叠。为解决混叠并提供更高质量语音合成,我们提出 WaveCycleGAN2,其 1)使用无下/上采样模块的生成器,2)结合波形域与声学参数域的判别器。结果表明所提方法 1)良好缓解混叠,2)对分析-合成与统计参数语音合成生成的语音波形均有效,3)在 NVIDIA Tesla P100 上以超过 150 kHz 的语音样本处理速率,取得了与自然语音及由 WaveNet(开放 WaveNet)和 WaveGlow 合成的语音相当的平均意见分。

关键词

引用

@article{arxiv.1904.02892,
  title  = {WaveCycleGAN2: Time-domain Neural Post-filter for Speech Waveform Generation},
  author = {Kou Tanaka and Hirokazu Kameoka and Takuhiro Kaneko and Nobukatsu Hojo},
  journal= {arXiv preprint arXiv:1904.02892},
  year   = {2019}
}

备注

Submitted to INTERSPEECH2019