SpatialNet:广泛学习空间信息用于多通道联合语音分离、去噪与去混响
声音
2023-12-25 v2 音频与语音处理
摘要
本工作提出一种神经网络,用于广泛利用空间信息实现多通道联合语音分离、去噪与去混响,命名为 SpatialNet。在短时傅里叶变换(STFT)域中,所提网络进行端到端语音增强。其主要由交错的窄带与跨带模块组成,分别利用窄带与跨带空间信息。窄带模块独立处理各频率,并利用自注意力机制与 temporal 卷积层分别执行基于空间特征的说话人聚类以及时间平滑/滤波。跨带模块独立处理各帧,并利用全带线性层与频率卷积层分别学习所有频率之间及相邻频率之间的相关性。在各种模拟与真实数据集上进行了实验,结果表明:1)所提网络在几乎所有任务上均达到最优(state-of-the-art)性能;2)所提网络几乎不受频谱泛化问题影响;3)所提网络确实在执行说话人聚类(由注意力图证实)。
引用
@article{arxiv.2307.16516,
title = {SpatialNet: Extensively Learning Spatial Information for Multichannel Joint Speech Separation, Denoising and Dereverberation},
author = {Changsheng Quan and Xiaofei Li},
journal= {arXiv preprint arXiv:2307.16516},
year = {2023}
}