听觉基Gabor特征在自动语音识别深度学习中的相关性
计算与语言
2017-02-15 v1
摘要
先前的研究支持将听觉基Gabor特征与深度学习架构相融合以实现鲁棒自动语音识别的观点,然而此种组合带来增益的原因仍未知。我们认为这些表征为深度学习解码器提供了更具判别性的线索。本文旨在通过分别在三个不同识别任务(Aurora 4、CHiME 2和CHiME 3)上进行实验来验证该假设,并评估Gabor滤波器组特征所编码信息的判别性。此外,为识别低、中、高时间调制频率子集的贡献,将Gabor滤波器组子集用作特征(分别称为LTM、MTM和HTM)。在16至25 Hz的时间调制频率下,HTM在各条件下均一致优于其余特征,凸显了这些表征针对信道失真、低信噪比及声学上具有挑战性的真实场景的鲁棒性,相较Mel滤波器组-DNN基线取得了11%至56%的相对提升。为解释结果,我们提出一种基于DNN激活的音素类间相似性度量,并将其与声学属性相关联。我们发现该度量与观测到的错误率一致,并突出音素层面的具体差异,以指明所提特征的益处。
引用
@article{arxiv.1702.04333,
title = {On the Relevance of Auditory-Based Gabor Features for Deep Learning in Automatic Speech Recognition},
author = {Angel Mario Castro Martinez and Sri Harish Mallidi and Bernd T. Meyer},
journal= {arXiv preprint arXiv:1702.04333},
year = {2017}
}
备注
accepted to Computer Speech & Language