面向端到端噪声鲁棒语音分离的梯度调制统一语音增强与分离方法
音频与语音处理
2023-02-23 v1 机器学习
声音
摘要
近年来基于神经网络的单通道语音分离(SS)研究因长序列建模能力的提升而取得显著成功。然而,在真实噪声条件下其性能会明显下降,因为背景噪声可能被误认为说话人语音,从而干扰分离出的声源。为缓解该问题,我们提出一种新颖的网络,通过梯度调制统一语音增强与分离以提升噪声鲁棒性。具体而言,我们首先将语音增强(SE)与分离模块结合构建统一网络,并采用多任务学习进行优化,其中 SE 由并行干净混合信号监督,以为下游语音分离降噪。此外,为避免降噪时抑制有效说话人信息,我们提出梯度调制(GM)策略,从优化视角协调 SE 与 SS 任务。实验结果表明,我们的方法在大规模 Libri2Mix- 和 Libri3Mix-noisy 数据集上取得了 SOTA 性能,SI-SNRi 结果分别为 16.0 dB 和 15.8 dB。我们的代码已在 GitHub 上公开。
引用
@article{arxiv.2302.11131,
title = {Unifying Speech Enhancement and Separation with Gradient Modulation for End-to-End Noise-Robust Speech Separation},
author = {Yuchen Hu and Chen Chen and Heqing Zou and Xionghu Zhong and Eng Siong Chng},
journal= {arXiv preprint arXiv:2302.11131},
year = {2023}
}
备注
5 pages, 5 figures, Accepted by ICASSP 2023