中文

WaveNODE:一种用于语音合成的连续归一化流

声音 2020-07-06 v4 计算与语言 机器学习 音频与语音处理

摘要

近年来,各种基于流的生成模型被提出以实时生成高保真波形。然而,这些模型要么需要训练良好的教师网络,要么需要较多流步骤,导致内存效率低下。在本文中,我们提出了一种称为 WaveNODE 的新型生成模型,其利用连续归一化流进行语音合成。与常规模型不同,WaveNODE 对用于流操作的函数不加约束,从而允许使用更灵活和复杂的函数。此外,WaveNODE 可在无需任何教师网络或辅助损失项的情况下优化以最大化似然。我们通过实验表明,与常规基于流的声码器相比,WaveNODE 以更少的参数实现了相当的性能。

关键词

引用

@article{arxiv.2006.04598,
  title  = {WaveNODE: A Continuous Normalizing Flow for Speech Synthesis},
  author = {Hyeongju Kim and Hyeonseung Lee and Woo Hyun Kang and Sung Jun Cheon and Byoung Jin Choi and Nam Soo Kim},
  journal= {arXiv preprint arXiv:2006.04598},
  year   = {2020}
}

备注

8 pages, 4 figures, Second workshop on Invertible Neural Networks, Normalizing Flows, and Explicit Likelihood Models (ICML 2020)