中文

空间、频谱与时间处理在基于 DNN 的非线性多通道语音增强中的作用

音频与语音处理 2022-06-23 v1 机器学习 声音

摘要

采用深度神经网络(DNNs)直接学习多通道语音增强滤波器,相较于将线性空间滤波器与独立的时-频谱后滤波器相结合的的传统方法,具有两个潜在关键优势:1)非线性空间滤波可克服源于线性处理模型的潜在限制;2)空间与时-频谱信息的联合处理可利用不同信息源间的相互依赖关系。近期提出了多种基于 DNN 的非线性滤波器,并报道了良好的增强性能。然而,关于其内部机制知之甚少,这使得网络架构设计如同碰运气。因此,本文通过实验以更好理解基于 DNN 的非线性滤波器对空间、频谱与时间信息的内部处理。一方面,我们在困难的语音提取场景中的实验证实了非线性空间滤波的重要性,其以 0.24 POLQA 分数优于预言线性空间滤波器。另一方面,我们证明联合处理导致利用频谱信息与时域信息(除空间信息外)的网络架构间存在 0.4 POLQA 分数的巨大性能差距。

关键词

引用

@article{arxiv.2206.11181,
  title  = {On the Role of Spatial, Spectral, and Temporal Processing for DNN-based Non-linear Multi-channel Speech Enhancement},
  author = {Kristina Tesch and Nils-Hendrik Mohrmann and Timo Gerkmann},
  journal= {arXiv preprint arXiv:2206.11181},
  year   = {2022}
}

备注

Accepted at Interspeech 2022