中文

用于恶劣真实环境语音识别的基于相干性的鲁棒谱增强

声音 2017-08-08 v4

摘要

在恶劣真实环境中的语音识别受到混响和非平稳背景噪声的严重影响。在多麦克风场景下,减少此类不期望信号分量的一个众所周知策略是对麦克风信号进行空间滤波。在本文中,我们证明了一个额外的基于相干性的后滤波器——应用于波束成形器输出信号以从中去除扩散干扰分量——是进一步提高现代深度学习语音识别系统识别精度的有效手段。为此,近期更新的第三届 CHiME 语音分离与识别挑战赛 (CHiME-3) 基线语音识别系统被一个基于相干性的后滤波器所扩展,并且针对 CHiME-3 提供的噪声环境考察了该后滤波器对词错误率的影响。为了确定与时间和频率相关的后滤波器增益,我们使用依赖于到达方向 (DOA) 和不依赖于 DOA 的相干到扩散功率比估计器作为短时信噪比的近似。我们的实验表明,将基于相干性的后滤波纳入 CHiME-3 基线语音识别系统,可显著降低 CHiME-3 所提供的噪声和混响环境中的词错误率分数。

关键词

引用

@article{arxiv.1604.03393,
  title  = {Robust coherence-based spectral enhancement for speech recognition in adverse real-world environments},
  author = {Hendrik Barfuss and Christian Huemmer and Andreas Schwarz and Walter Kellermann},
  journal= {arXiv preprint arXiv:1604.03393},
  year   = {2017}
}

备注

21 pages, 5 figures. arXiv admin note: substantial text overlap with arXiv:1509.06882, Elsevier Computer Speech & Language (CSL), 2017