中文

VSEGAN:视觉语音增强生成对抗网络

音频与语音处理 2022-04-21 v2 声音 图像与视频处理

摘要

语音增强是在噪声场景下提升语音质量的一项基本任务。由于语音的视觉方面本质上不受声学环境影响,若干最先进方法已引入视觉信息进行语音增强。本文提出一种结合生成对抗网络(GAN)利用视觉信息进行语音增强的新框架。具体而言,所提出的视觉语音增强 GAN 由以对抗方式训练的两个网络组成:i) 采用多层特征融合卷积网络来增强输入含噪语音的生成器;ii) 试图最小化干净语音信号与增强语音信号分布间差异的判别器。实验结果表明,所提模型相对于若干最先进方法具有更优性能。

关键词

引用

@article{arxiv.2102.02599,
  title  = {VSEGAN: Visual Speech Enhancement Generative Adversarial Network},
  author = {Xinmeng Xu and Yang Wang and Dongxiang Xu and Yiyuan Peng and Cong Zhang and Jie Jia and Binbin Chen},
  journal= {arXiv preprint arXiv:2102.02599},
  year   = {2022}
}

备注

Accepted by ICASSP 2022