面向语音增强的交互式语音与噪声建模
音频与语音处理
2021-04-15 v2 声音
信号处理
摘要
由于背景噪声类型的多样性,语音增强具有挑战性。现有大多数方法侧重于对语音而非噪声进行建模。本文提出一种在新颖的双分支卷积神经网络(即 SN-Net)中同时建模语音与噪声的思路。在 SN-Net 中,两个分支分别预测语音与噪声。不同于仅在最终输出层进行信息融合,我们在两分支间的若干中间特征域引入交互模块以相互增益。这种交互可利用从一个分支学到的特征来抵消另一分支的不期望部分并恢复其缺失成分,从而增强各自的判别能力。我们还设计了一个特征提取模块,即残差卷积与注意力(RA),以捕获语音与噪声在时间与频率维度上的相关性。在公开数据集上的评估表明,交互模块在同步建模中起关键作用,且 SN-Net 在各种评估指标上大幅优于当前最优方法(SOTA)。所提出的 SN-Net 在说话人分离任务上也展现出优越性能。
引用
@article{arxiv.2012.09408,
title = {Interactive Speech and Noise Modeling for Speech Enhancement},
author = {Chengyu Zheng and Xiulian Peng and Yuan Zhang and Sriram Srinivasan and Yan Lu},
journal= {arXiv preprint arXiv:2012.09408},
year = {2021}
}
备注
AAAI 2021 (Accepted)