Spatial-DCCRN:配备帧级角度特征与混合滤波的多通道语音增强模型
音频与语音处理
2022-10-18 v1 声音
摘要
近年来,由于利用空间信息将目标语音与干扰信号区分开来,多通道语音增强引起了广泛关注。为充分利用空间信息与基于神经网络的掩码估计,我们提出了一种多通道去噪神经网络——Spatial DCCRN。首先,我们将 S-DCCRN 扩展至多通道场景,旨在执行级联子通道与全通道处理策略,从而可对不同通道分别建模。此外,不同于仅采用多通道频谱或拼接第一通道幅度与 IPD 作为模型输入,我们应用角度特征提取模块(AFE)提取帧级角度特征嵌入,以帮助模型显式感知空间信息。最后,由于当噪声与语音存在于同一时频(TF)单元时残差噪声现象会更严重,我们特别设计了一种掩码与映射滤波方法以替代传统的滤波求和操作,目的是级联实现粗去噪、去混响与残差噪声抑制。所提出的模型 Spatial-DCCRN 在 L3DAS22 挑战赛数据集上超越了 EaBNet、FasNet 以及若干竞争性模型。不仅在 3D 场景下,Spatial-DCCRN 在多通道 ConferencingSpeech2021 挑战赛数据集的多个评价指标上还大幅优于当前最优(SOTA)模型 MIMO-UNet。消融实验也证明了各项贡献的有效性。
引用
@article{arxiv.2210.08802,
title = {spatial-dccrn: dccrn equipped with frame-level angle feature and hybrid filtering for multi-channel speech enhancement},
author = {Shubo Lv and Yihui Fu and Yukai Jv and Lei Xie and Weixin Zhu and Wei Rao and Yannan Wang},
journal= {arXiv preprint arXiv:2210.08802},
year = {2022}
}