中文

FloWaveNet:一种用于原始音频的生成流模型

声音 2019-05-21 v3 音频与语音处理

摘要

大多数现代文本到语音架构使用WaveNet声码器来合成高保真波形音频,但由于其祖先采样方案,在实际应用中有推理时间高等局限。最近提出的Parallel WaveNet和ClariNet通过引入逆自回归流进行并行采样,实现了实时音频合成能力。然而,这些方法需要带有训练良好教师网络的两阶段训练流程,并且只能通过使用概率蒸馏及辅助损失项来产生自然声音。我们提出FloWaveNet,一种基于流的原始音频合成生成模型。FloWaveNet仅需单阶段训练过程和单一最大似然损失,无需任何额外辅助项,并且由于生成流的特性,它本质上是并行的。该模型能够实时高效采样原始音频,其清晰度可与先前两阶段并行模型相媲美。包括我们的FloWaveNet在内的所有模型的代码和样本均已公开可用。

关键词

引用

@article{arxiv.1811.02155,
  title  = {FloWaveNet : A Generative Flow for Raw Audio},
  author = {Sungwon Kim and Sang-gil Lee and Jongyoon Song and Jaehyeon Kim and Sungroh Yoon},
  journal= {arXiv preprint arXiv:1811.02155},
  year   = {2019}
}

备注

9 pages, ICML'2019