中文

基于可学习滤波器组的多通道掩蔽语音源分离

音频与语音处理 2023-03-15 v1 声音

摘要

本工作提出了一种基于多通道掩蔽框架、采用可学习滤波器组的多通道源分离方法。该可学习滤波器组是一个一维卷积(1D Conv)层,将原始波形转换为二维表示。与传统的单通道掩蔽方法不同,我们为每个独立的麦克风通道估计一个掩蔽。所估计的掩蔽随后被应用于转换后的波形表示,类似于传统的滤波求和波束形成操作。具体而言,每个掩蔽用于乘对应通道的二维表示,然后对所有通道的掩蔽输出求和。最后,使用一个一维转置卷积层将求和后的掩蔽信号转换回波形域。实验结果表明,我们的方法优于采用可学习滤波器组的单通道掩蔽方法,并且当可学习滤波器组被转换到更高特征维度时,能够在 STGCSEN 模型中胜过基于 STFT 复谱的多通道复掩蔽。空间响应分析也验证了在可学习滤波器组域中的多通道掩蔽具有空间选择性。

关键词

引用

@article{arxiv.2303.07816,
  title  = {Multi-Channel Masking with Learnable Filterbank for Sound Source Separation},
  author = {Wang Dai and Archontis Politis and Tuomas Virtanen},
  journal= {arXiv preprint arXiv:2303.07816},
  year   = {2023}
}