用于多通道语音分离的隐式滤波求和网络
音频与语音处理
2020-11-18 v1 声音
摘要
近年来针对多通道语音分离任务提出了多种神经网络架构。其中,滤波求和网络(FaSNet)执行端到端时域滤波求和波束形成,并在自组织与固定麦克风阵列几何中均表现有效。本文研究多种提升FaSNet性能的方法。从问题建模角度,我们将涉及所有麦克风的显式时域滤波求和操作,改为仅在参考麦克风隐空间中的隐式滤波求和操作。滤波求和操作应用于待分离帧周围的上下文。这使得问题建模能更好匹配端到端分离的目标。从特征提取角度,我们将样本级归一化互相关(NCC)特征的计算修改为特征级NCC(fNCC)特征。这使模型更好匹配隐式滤波求和建模。在自组织与固定麦克风阵列几何上的实验结果表明,我们所提出的对FaSNet的改进(称为iFaSNet)能在所有条件下以相当的模型复杂度显著优于基准FaSNet。
引用
@article{arxiv.2011.08401,
title = {Implicit Filter-and-sum Network for Multi-channel Speech Separation},
author = {Yi Luo and Nima Mesgarani},
journal= {arXiv preprint arXiv:2011.08401},
year = {2020}
}