中文

SEFGAN:利用归一化流和生成对抗网络实现高效高质量语音增强

音频与语音处理 2023-12-05 v1

摘要

本文提出SEFGAN,一种结合最大似然训练和生成对抗网络(GAN)的深度神经网络(DNN),用于高效语音增强(SE)。为此,训练一个DNN,在GAN框架下以归一化流(NF)作为生成器,基于带噪语音合成增强语音。虽然似然模型与GAN的结合并非易事,但SEFGAN表明,混合对抗和最大似然训练方法使模型能够保持高质量音频生成和对数似然估计。我们的实验表明,该方法在不增加增强网络复杂性的情况下,显著优于基于NF的基线模型。通过计算指标和听力实验的比较表明,SEFGAN与其他最先进模型具有竞争力。

关键词

引用

@article{arxiv.2312.01744,
  title  = {SEFGAN: Harvesting the Power of Normalizing Flows and GANs for Efficient High-Quality Speech Enhancement},
  author = {Martin Strauss and Nicola Pia and Nagashree K. S. Rao and Bernd Edler},
  journal= {arXiv preprint arXiv:2312.01744},
  year   = {2023}
}

备注

Preprint. Accepted to IEEE Workshop on Applications of Signal Processing to Audio and Acoustics (WASPAA) 2023