中文

用于多通道语音增强的窄带深度滤波

声音 2020-09-24 v2 音频与语音处理

摘要

在本文中,我们解决短时傅里叶变换(STFT)域中的多通道语音增强问题。长短期记忆(LSTM)网络以与多通道含噪语音信号的某个频率 bin 相关联的 STFT 系数序列作为输入。该网络的输出是相应的单通道干净语音序列。我们提出了几种干净语音网络目标,即幅度比掩码、复数 STFT 系数以及(平滑的)空间滤波器。所提模型的一个显著特征是,相同的 LSTM 架构及其相同参数在多个频率 bin 上训练。该方法被称为窄带深度滤波。这一选择与传统宽带语音增强方法形成对比。所提深度滤波能够通过利用语音与噪声不同的时域和空间特性来区分二者:语音是非平稳的且在空间上相干的,而噪声相对平稳且在各通道间弱相关。这在思想上与无监督技术(如谱减法和波束成形)类似。我们描述了使用混合信号(向干净语音中添加噪声)和真实信号(现场录音)的大量实验。我们使用语音增强和语音识别指标对所提架构变体进行经验评估,并将我们的结果与若干最先进(SOTA)方法所得结果进行比较。根据这些实验,我们得出结论:窄带深度滤波具有非常好的语音增强和语音识别性能,以及在说话人可变性和噪声类型方面出色的泛化能力。

关键词

引用

@article{arxiv.1911.10791,
  title  = {Narrow-band Deep Filtering for Multichannel Speech Enhancement},
  author = {Xiaofei LI and Radu Horaud},
  journal= {arXiv preprint arXiv:1911.10791},
  year   = {2020}
}

备注

Submitted to IEEE/ACM Transactions on Audio, Speech and Language Processing