中文

基于空间选择性深度非线性滤波器的多通道语音分离

音频与语音处理 2024-01-11 v2 机器学习 声音

摘要

在多个说话人的多通道分离任务中,我们旨在从混合信号中恢复所有独立的语音信号。与依赖语音信号不同谱-时域特征的单通道方法不同,多通道方法应额外利用声源的不同空间位置以实现更强的分离能力,尤其在声源数量增加时。为增强多通道源分离场景中的空间处理,本文提出一种基于深度神经网络 (DNN) 的空间选择性滤波器 (SSF),该滤波器可通过用目标方向初始化循环神经网络层来空间导向以提取感兴趣说话人。我们将所提 SSF 与常用的端到端直接分离 (DS) 方法进行比较,后者使用语句级置换不变训练 (PIT) 训练,仅隐式学习执行空间滤波。我们表明,当混合信号中说话人多于两个时,SSF 在相同底层网络架构下相较于 DS 方法具有明显优势,这可归因于对空间信息的更好利用。此外,我们发现 SSF 对训练时未见的额外噪声源以及说话人处于相似角度的场景泛化能力更好。

关键词

引用

@article{arxiv.2304.12023,
  title  = {Multi-channel Speech Separation Using Spatially Selective Deep Non-linear Filters},
  author = {Kristina Tesch and Timo Gerkmann},
  journal= {arXiv preprint arXiv:2304.12023},
  year   = {2024}
}

备注

Accepted version