利用 LSTM 神经网络增强基于空间聚类的时频掩码
声音
2020-12-04 v1 机器学习
音频与语音处理
摘要
近期工作表明,采用 LSTM 架构的深度循环神经网络可通过估计时频掩码实现较强的单通道语音增强。然而,这些模型不能自然地推广到来自不同麦克风配置的多通道输入。相比之下,空间聚类技术可实现此类泛化,但缺乏强信号模型。我们的工作提出了一种结合两种方案的方法。通过使用 LSTM 增强基于空间聚类的时频掩码,我们同时获得了多个单通道 LSTM-DNN 语音增强器的信号建模性能,以及多通道空间聚类的信号分离性能与通用性。我们在 CHiME-3 数据集上将所提系统与若干基线进行比较。我们使用 BSS_eval 工具包的 SDR 与 PESQ 评估各系统的音频质量,并使用 Kaldi 自动语音识别器的词错误率评估各系统的可懂度。
引用
@article{arxiv.2012.01576,
title = {Enhancement of Spatial Clustering-Based Time-Frequency Masks using LSTM Neural Networks},
author = {Felix Grezes and Zhaoheng Ni and Viet Anh Trinh and Michael Mandel},
journal= {arXiv preprint arXiv:2012.01576},
year = {2020}
}