VSEGAN:视觉语音增强生成对抗网络
音频与语音处理
2022-04-21 v2 声音
图像与视频处理
摘要
语音增强是在噪声场景下提升语音质量的一项基本任务。由于语音的视觉方面本质上不受声学环境影响,若干最先进方法已引入视觉信息进行语音增强。本文提出一种结合生成对抗网络(GAN)利用视觉信息进行语音增强的新框架。具体而言,所提出的视觉语音增强 GAN 由以对抗方式训练的两个网络组成:i) 采用多层特征融合卷积网络来增强输入含噪语音的生成器;ii) 试图最小化干净语音信号与增强语音信号分布间差异的判别器。实验结果表明,所提模型相对于若干最先进方法具有更优性能。
引用
@article{arxiv.2102.02599,
title = {VSEGAN: Visual Speech Enhancement Generative Adversarial Network},
author = {Xinmeng Xu and Yang Wang and Dongxiang Xu and Yiyuan Peng and Cong Zhang and Jie Jia and Binbin Chen},
journal= {arXiv preprint arXiv:2102.02599},
year = {2022}
}
备注
Accepted by ICASSP 2022