用于远场语音识别的频域多通道声学建模
音频与语音处理
2021-12-23 v2 声音
摘要
传统的远场自动语音识别(ASR)系统通常采用麦克风阵列技术进行语音增强,以提升对噪声或混响的鲁棒性。然而,此类语音增强技术未必能改善ASR准确率,因为语音增强的优化准则与ASR目标并不直接相关。本工作中,我们开发了基于ASR准则直接优化来自多通道(MC)输入的空间滤波与长短期记忆(LSTM)层的新型声学建模技术。与传统方法不同,我们将阵列处理知识融入声学模型。此外,我们用波束形成器的系数初始化网络。我们通过在真实世界远场数据上的ASR实验考察了此类MC神经网络的效果,其中用户在非受控声学环境中与ASR系统交互。我们表明,相较于采用传统log-mel滤波器组能量(LFBE)特征的单通道ASR系统,我们的MC声学模型平均可降低词错误率(WER)约16.5%。我们的结果还显示,具有空间滤波层、基于双通道输入的网络相较七麦克风的传统波束形成取得了约9.5%的相对WER降低。
引用
@article{arxiv.1903.05299,
title = {Frequency Domain Multi-channel Acoustic Modeling for Distant Speech Recognition},
author = {Minhua Wu and Kenichi Kumatani and Shiva Sundaram and Nikko Strom and Bjorn Hoffmeister},
journal= {arXiv preprint arXiv:1903.05299},
year = {2021}
}
备注
ICASSP 2019, 5 pages