中文

Parallel WaveGAN:一种基于生成对抗网络与多分辨率谱图的快速波形生成模型

音频与语音处理 2020-02-07 v2 机器学习 声音 信号处理

摘要

我们提出 Parallel WaveGAN,一种无需蒸馏、快速且小体积的波形生成方法,其使用生成对抗网络。在所提方法中,一个非自回归 WaveNet 通过联合优化多分辨率谱图与对抗损失函数进行训练,能够有效捕捉真实语音波形的时频分布。由于我们的方法不需要传统教师-学生框架中使用的密度蒸馏,整个模型可以轻松训练。此外,即便采用紧凑架构,我们的模型也能生成高保真语音。特别地,所提出的 Parallel WaveGAN 仅有 1.44 M 参数,在单 GPU 环境下能以比实时快 28.68 倍的速度生成 24 kHz 语音波形。感知听测结果表明,在基于 Transformer 的文本到语音框架内,我们提出的方法取得了 4.16 的平均意见得分,与最佳的基于蒸馏的 Parallel WaveNet 系统相当。

关键词

引用

@article{arxiv.1910.11480,
  title  = {Parallel WaveGAN: A fast waveform generation model based on generative adversarial networks with multi-resolution spectrogram},
  author = {Ryuichi Yamamoto and Eunwoo Song and Jae-Min Kim},
  journal= {arXiv preprint arXiv:1910.11480},
  year   = {2020}
}

备注

Accepted to the conference of ICASSP 2020