用于大词汇量连续语音识别的发音信息与多视角特征
计算与语言
2018-02-19 v1 声音
音频与语音处理
摘要
本文探讨了在卷积深度神经网络 (CNN) 架构中使用多视角特征及其判别变换来完成大词汇量连续语音识别任务。在特征空间最大似然线性回归 (fMLLR) 变换后,使用梅尔滤波器组能量和感知驱动的受迫阻尼振荡器系数 (DOC) 特征,将其组合并作为多视角特征输入到单个 CNN 声学模型中。与使用单个特征相比,多视角特征表示的使用显著降低了词错误率 (WER)。此外,当将发音信息作为附加输入用于融合的深度神经网络 (DNN) 和 CNN 声学模型时,发现其进一步降低了 NIST 2000 会话电话语音测试集中 Switchboard 子集和 CallHome 子集(包含部分非母语口音语音)的 WER,在两种情况下相对基线均降低了 12% 的错误率。本工作表明,多视角特征结合发音信息可提高语音识别对自发和非母语语音的鲁棒性。
引用
@article{arxiv.1802.05853,
title = {Articulatory information and Multiview Features for Large Vocabulary Continuous Speech Recognition},
author = {Vikramjit Mitra and Wen Wang and Chris Bartels and Horacio Franco and Dimitra Vergyri},
journal= {arXiv preprint arXiv:1802.05853},
year = {2018}
}
备注
5 pages