中文

基于多通道 NMF 引导波束形成的无监督语音增强用于噪声鲁棒自动语音识别

声音 2019-04-02 v2 机器学习 音频与语音处理 机器学习

摘要

本文描述了用于改善噪声环境下自动语音识别 (ASR) 的多通道语音增强。近来,最小方差无失真响应 (MVDR) 波束形成已被广泛使用,因为如果给定语音导向矢量和噪声的空间协方差矩阵 (SCM),其效果良好。为估计此类空间信息,传统研究采用有监督方法,通过训练深度神经网络 (DNN) 将每个时频 (TF) 单元分类为噪声或语音。然而,在未知噪声环境下 ASR 性能会下降。为解决该问题,我们采用无监督方法,利用多通道非负矩阵分解 (MNMF) 将每个 TF 单元分解为语音与噪声之和。这使我们能够从分离出的语音和噪声分量而非观测到的噪声混合中准确估计语音和噪声的 SCM。本文提出通过有效初始化和增量更新 MNMF 参数来实现在线 MVDR 波束形成。另一主要贡献是全面研究将各类空间滤波器(即 MVDR 波束形成器以及秩 1 和全秩多通道维纳滤波器的时不变与时变版本)与 MNMF 结合所获得的 ASR 性能。实验结果表明,所提方法在未知且与训练数据不匹配的环境中优于最先进的基于 DNN 的波束形成方法。

关键词

引用

@article{arxiv.1903.09341,
  title  = {Unsupervised Speech Enhancement Based on Multichannel NMF-Informed Beamforming for Noise-Robust Automatic Speech Recognition},
  author = {Kazuki Shimada and Yoshiaki Bando and Masato Mimura and Katsutoshi Itoyama and Kazuyoshi Yoshii and Tatsuya Kawahara},
  journal= {arXiv preprint arXiv:1903.09341},
  year   = {2019}
}