面向远场语音识别的多几何空间声学建模
音频与语音处理
2021-12-23 v2 声音
摘要
利用多麦克风的空间信息可提高远场自动语音识别(ASR)的准确率。然而,当设计与测试条件下的阵列几何不匹配时,传统麦克风阵列技术的语音增强性能会下降。此外,由于语音增强与ASR优化目标存在差异,此类语音增强技术并不总能带来ASR准确率的提升。在本工作中,我们提出通过从多通道(MC)输入优化空间滤波与长短期记忆(LSTM)层来统一声学模型框架。我们的声学模型涵盖了多种阵列几何类型的波束成形器。与将神经网络视为黑箱工具的深度聚类方法不同,编码空间滤波器的网络能够实时处理流式音频数据,而无需累积目标信号统计量。我们通过真实世界远场数据的ASR实验证明了此类MC神经网络的有效性。我们表明,在匹配与不匹配的麦克风摆放条件下,与采用对数梅尔滤波器组能量(LFBE)特征的单通道ASR系统相比,我们的双通道声学模型平均可分别降低词错误率(WER)约13.4%和12.7%。我们的结果还显示,相较于采用七个麦克风的传统波束成形,我们的双通道网络总体实现了超过约7.0%的相对WER降低。
引用
@article{arxiv.1903.06539,
title = {Multi-Geometry Spatial Acoustic Modeling for Distant Speech Recognition},
author = {Kenichi Kumatani and Minhua Wu and Shiva Sundaram and Nikko Strom and Bjorn Hoffmeister},
journal= {arXiv preprint arXiv:1903.06539},
year = {2021}
}
备注
ICASSP2019, 5 pages. arXiv admin note: substantial text overlap with arXiv:1903.05299