SkipConvGAN:基于生成对抗网络与复时频掩蔽的单通道语音去混响
音频与语音处理
2022-11-24 v1 机器学习
声音
摘要
随着深度学习方法的进展,在背景噪声存在下语音增强系统的性能已有显著提升。然而,提升系统对混响的鲁棒性仍是一项进行中的工作,因为混响往往由于时间和频率上的拖尾效应导致共振峰结构丢失。广泛的基于深度学习的系统要么增强幅度响应并复用失真的相位,要么使用复时频掩蔽增强复谱图。尽管这些方法已展现出令人满意的性能,它们并未直接解决混响引起的共振峰结构丢失问题。我们认为恢复共振峰结构有助于提升现有系统的效率。在本研究中,我们提出SkipConvGAN——我们先前工作SkipConvNet的扩展。所提系统的生成器网络试图估计高效的复时频掩蔽,而判别器网络则辅助驱动生成器恢复丢失的共振峰结构。我们在REVERB挑战语料库单通道任务中的仿真与真实混响语音录音上评估了所提系统的性能。所提系统在多种房间配置下相较其他基于深度学习的生成对抗框架均展现出一致的改进。
引用
@article{arxiv.2211.12623,
title = {SkipConvGAN: Monaural Speech Dereverberation using Generative Adversarial Networks via Complex Time-Frequency Masking},
author = {Vinay Kothapally and J. H. L. Hansen},
journal= {arXiv preprint arXiv:2211.12623},
year = {2022}
}
备注
Published in: IEEE/ACM Transactions on Audio, Speech, and Language Processing ( Volume: 30)