一种基于深度表示学习与复卷积循环变分自编码器的语音增强方法
音频与语音处理
2023-12-18 v1
摘要
通常,深度神经网络(DNN)的性能在很大程度上取决于数据表示学习的质量。我们的前期工作强调了深度表示学习(DRL)在语音增强(SE)应用中的重要性。具体而言,我们最初的 SE 算法采用具有高斯分布的门控循环单元变分自编码器(VAE),以提升某些现有 SE 系统的性能。在前述框架的基础上,本文引入了一种使用带有 VAE 的深度复卷积循环网络(DCCRN-VAE)的 SE 新方法。DCCRN-VAE 假设信号的潜变量遵循由 DCCRN 建模的复高斯分布,因为这些分布能更好地捕捉复信号的行为。此外,我们提出在 DCCRN-VAE 中应用残差损失,以进一步提高增强语音的质量。与前期的初步工作相比,DCCRN-VAE 为 DRL 引入了更复杂的 DCCRN 结构和概率分布。此外,与 DCCRN 相比,DCCRN-VAE 采用了更先进的 DRL 策略。实验结果表明,所提出的 SE 算法在尺度不变信噪比、语音质量和语音可懂度方面均优于我们前期的 SE 框架和 SOTA 的 DCCRN SE 方法。
引用
@article{arxiv.2312.09620,
title = {A Deep Representation Learning-based Speech Enhancement Method Using Complex Convolution Recurrent Variational Autoencoder},
author = {Yang Xiang and Jingguang Tian and Xinhui Hu and Xinkang Xu and ZhaoHui Yin},
journal= {arXiv preprint arXiv:2312.09620},
year = {2023}
}
备注
Accepted by ICASSP 2024