iSEGAN:改进的语音增强生成对抗网络
音频与语音处理
2020-02-21 v1 声音
信号处理
摘要
流行的基于神经网络的语音增强系统作用于幅度谱图,并忽略了含噪语音与干净语音信号之间的相位失配。条件生成对抗网络(cGAN)通过直接将原始含噪语音波形映射到潜在的干净语音信号,在解决相位失配问题上展现出前景。然而,cGAN系统的稳定与训练较为困难,且其性能仍不及谱增强方法。本文研究了不同的归一化策略与单边标签平滑是否能进一步稳定基于cGAN的语音增强模型。此外,我们提出引入基于Gammatone的听觉滤波层与可训练预加重层,以进一步提升cGAN框架的性能。仿真结果表明,所提方法在提升cGAN系统语音增强性能的同时,还带来了更好的稳定性并降低了计算开销。
引用
@article{arxiv.2002.08796,
title = {iSEGAN: Improved Speech Enhancement Generative Adversarial Networks},
author = {Deepak Baby},
journal= {arXiv preprint arXiv:2002.08796},
year = {2020}
}
备注
A short report on improving SEGAN performance