中文

复神经空间滤波器:增强复域多通道目标语音分离

声音 2021-09-08 v1 音频与语音处理

摘要

迄今为止,主流的目标语音分离(TSS)方法被构建为在监督深度学习框架下估计时频域中目标语音的复比值掩码(cRM)。然而,现有用于估计cRM的深度模型以如下方式设计:cRM的实部与虚部分别使用实值训练数据对进行建模。本研究的动机是设计一个深度模型,充分利用多通道信号的时-谱-空信息,直接在复域中高效估计cRM。为此,设计了一种新颖的TSS网络,由两个模块组成:复神经空间滤波器(cNSF)与MVDR。本质上,cNSF是一个cRM估计模型,其后级联MVDR模块以减小神经网络引入的非线性语音失真。具体而言,为拟合cRM目标,cNSF的所有输入特征遵循监督学习范式被重构为复值表示。进而,为实现良好的层次化特征抽象,精心设计了具有U-Net结构的复深度神经网络(cDNN)。在模拟多通道语音数据上的实验表明,所提cNSF相较基线NSF在尺度不变信失真比上提升12.1%,在词错误率上降低33.1%。

关键词

引用

@article{arxiv.2104.12359,
  title  = {Complex Neural Spatial Filter: Enhancing Multi-channel Target Speech Separation in Complex Domain},
  author = {Rongzhi Gu and Shi-Xiong Zhang and Yuexian Zou and Dong Yu},
  journal= {arXiv preprint arXiv:2104.12359},
  year   = {2021}
}

备注

5 pages, 3 figures