用于多通道远场语音识别的改进调频特征
声音
2019-09-04 v1 人机交互
摘要
调频特征捕捉语音共振峰的精细结构,构成对传统基于能量的倒谱特征有益且互补的信息。其改进效果主要在 GMM-HMM 系统的小词汇量与大词汇量任务中得到证实。然而,它们在 DNN-HMM 系统与远场语音识别 (DSR) 任务中的应用有限。在此,我们详细阐述将其集成到最先进的前端方案中,该方案包括对 MFCC 的后处理,从而产生具有大时间上下文的判别性与说话人自适应特征。我们探索 1) 用于多麦克风设置的多通道解调方案,2) 更丰富的调频描述子,以及 3) 通过分层深度网络进行特征变换与组合。我们给出分别采用 GMM 与 DNN 声学模型的串联与混合识别结果。改进后的调频特征与 MFCC 高效结合,在混响与噪声环境下的多通道远场语音识别任务中带来温和且一致的改进,此类任务识别率远不及人类表现。
引用
@article{arxiv.1811.09381,
title = {Improved Frequency Modulation Features for Multichannel Distant Speech Recognition},
author = {Isidoros Rodomagoulakis and Petros Maragos},
journal= {arXiv preprint arXiv:1811.09381},
year = {2019}
}