中文

StyleMelGAN:一种具有时间自适应归一化的高效高保真对抗声码器

音频与语音处理 2021-02-15 v2 机器学习 声音 信号处理

摘要

近年来,神经声码器在合成语音的自然度和感知质量上已超越经典语音生成方法。WaveNet 和 WaveGlow 等计算繁重的模型取得了最佳效果,而 MelGAN 和 Parallel WaveGAN 等轻量级 GAN 模型在感知质量上仍逊一筹。因此我们提出 StyleMelGAN,一种轻量级神经声码器,能够以低计算复杂度合成高保真语音。StyleMelGAN 采用时间自适应归一化,用目标语音的声学特征对低维噪声向量进行风格化。为高效训练,多个随机窗口判别器通过对滤波器组分析的语音信号进行对抗性评估,并由多尺度谱重建损失提供正则化。高度可并行的语音生成在 CPU 和 GPU 上比实时快数倍。MUSHRA 和 P.800 听力测试表明,StyleMelGAN 在复制合成与文本转语音场景中均优于先前的神经声码器。

关键词

引用

@article{arxiv.2011.01557,
  title  = {StyleMelGAN: An Efficient High-Fidelity Adversarial Vocoder with Temporal Adaptive Normalization},
  author = {Ahmed Mustafa and Nicola Pia and Guillaume Fuchs},
  journal= {arXiv preprint arXiv:2011.01557},
  year   = {2021}
}

备注

Accepted to ICASSP2021