DCCRGAN:用于语音增强的深度复数卷积循环生成对抗网络
音频与语音处理
2021-03-09 v2 声音
摘要
生成对抗网络(GAN)在处理语音增强(SE)任务时仍存在一些问题。一些基于 GAN 的系统直接采用从像素到像素相同的结构而未作专门优化。生成器网络的重要性尚未被充分挖掘。其他相关研究改变了生成器网络但在时频域操作,忽略了相位失配问题。为解决这些问题,本文提出一种深度复数卷积循环 GAN(DCCRGAN)结构。复数模块建立了波形幅度与相位之间的相关性,且已被证明是有效的。所提结构以端到端方式训练。生成器网络中使用了不同的 LSTM 层以充分挖掘 DCCRGAN 的语音增强性能。实验结果证实,所提 DCCRGAN 优于最先进的基于 GAN 的 SE 系统。
引用
@article{arxiv.2012.10732,
title = {DCCRGAN: Deep Complex Convolution Recurrent Generator Adversarial Network for Speech Enhancement},
author = {Huixiang Huang and Renjie Wu and Jingbiao Huang and Jucai Lin and Jun Yin},
journal= {arXiv preprint arXiv:2012.10732},
year = {2021}
}