中文

用于远场语音识别的频域多通道声学建模

音频与语音处理 2021-12-23 v2 声音

摘要

传统的远场自动语音识别(ASR)系统通常采用麦克风阵列技术进行语音增强,以提升对噪声或混响的鲁棒性。然而,此类语音增强技术未必能改善ASR准确率,因为语音增强的优化准则与ASR目标并不直接相关。本工作中,我们开发了基于ASR准则直接优化来自多通道(MC)输入的空间滤波与长短期记忆(LSTM)层的新型声学建模技术。与传统方法不同,我们将阵列处理知识融入声学模型。此外,我们用波束形成器的系数初始化网络。我们通过在真实世界远场数据上的ASR实验考察了此类MC神经网络的效果,其中用户在非受控声学环境中与ASR系统交互。我们表明,相较于采用传统log-mel滤波器组能量(LFBE)特征的单通道ASR系统,我们的MC声学模型平均可降低词错误率(WER)约16.5%。我们的结果还显示,具有空间滤波层、基于双通道输入的网络相较七麦克风的传统波束形成取得了约9.5%的相对WER降低。

关键词

引用

@article{arxiv.1903.05299,
  title  = {Frequency Domain Multi-channel Acoustic Modeling for Distant Speech Recognition},
  author = {Minhua Wu and Kenichi Kumatani and Shiva Sundaram and Nikko Strom and Bjorn Hoffmeister},
  journal= {arXiv preprint arXiv:1903.05299},
  year   = {2021}
}

备注

ICASSP 2019, 5 pages