基于动态注意力生成对抗网络及相位后处理的语音增强方法
声音
2020-06-16 v1 音频与语音处理
摘要
生成对抗网络(GANs)近年来推动了语音增强的发展。然而,与最先进的模型相比,其性能优势仍然有限。本文提出了一种强大的动态注意力递归生成对抗网络,称为 DARGAN,用于时频域降噪。与以往工作不同,我们有以下几项创新。首先,在生成器中采用了递归学习这一迭代训练协议,该协议包含多个步骤。通过在每一步中复用网络,噪声成分以逐步方式被渐进式减少。其次,部署了动态注意力机制,有助于在降噪模块中重新调整特征分布。第三,我们利用深度 Griffin-Lim 算法作为相位后处理模块,这有助于进一步提升语音质量。在 Voice Bank 语料库上的实验结果表明,所提出的 GAN 相比以往基于 GAN 和非 GAN 的模型,达到了最先进的性能。
引用
@article{arxiv.2006.07530,
title = {Dynamic Attention Based Generative Adversarial Network with Phase Post-Processing for Speech Enhancement},
author = {Andong Li and Chengshi Zheng and Renhua Peng and Cunhang Fan and Xiaodong Li},
journal= {arXiv preprint arXiv:2006.07530},
year = {2020}
}
备注
5 pages, 3 figures