中文

在串联GMM-HMM系统中使用PCA网络和LSTM进行视觉语音识别

计算机视觉与模式识别 2017-10-20 v1

摘要

自动视觉语音识别是模式识别中一个有趣的问题,尤其是在音频数据有噪声或不易获得时。由于视觉发音所包含的信息量相比可听话语较少,这也是一项非常具有挑战性的任务。本工作中,对从视频数据中提取的图像块应用主成分分析,以学习一个两级卷积网络的权重。然后提取块直方图作为无监督学习特征。这些特征被用于学习一个带有长短期记忆单元集的循环神经网络,以获得时空特征。最后,将获得的特征用于串联GMM-HMM系统进行语音识别。我们的结果表明,所提出的方法在OuluVS2视听数据库上的短语识别中优于基线技术,在正面视图交叉验证和测试中,句子正确率分别达到79%和73%,而基线交叉验证正确率为74%。

关键词

引用

@article{arxiv.1710.07161,
  title  = {Visual Speech Recognition Using PCA Networks and LSTMs in a Tandem GMM-HMM System},
  author = {Marina Zimmermann and Mostafa Mehdipour Ghazi and Hazım Kemal Ekenel and Jean-Philippe Thiran},
  journal= {arXiv preprint arXiv:1710.07161},
  year   = {2017}
}