中文

基于 LSTMs 的端到端视觉语音识别

计算机视觉与模式识别 2017-01-23 v1 计算与语言

摘要

传统的视觉语音识别系统包括两个阶段:特征提取和分类。最近,提出了几种深度学习方法,从嘴部图像中自动提取特征,旨在取代特征提取阶段。然而,关于特征与分类联合学习的研究非常有限。在这项工作中,我们提出了一种基于长-短记忆(LSTM)网络的端到端视觉语音识别系统。据我们所知,这是首个同时从像素中直接提取特征并进行分类,且在视觉语音分类中达到最先进性能的模型。该模型由两条流组成,分别直接从嘴部和差分图像中提取特征。每条流中的时间动态由 LSTM 建模,两条流的融合通过双向 LSTM(BLSTM)实现。在 OuluVS2 数据库上报告了比基线绝对提升 9.7%,在 CUAVE 数据库上比使用类似视觉前端的其它方法绝对提升 1.5%。

关键词

引用

@article{arxiv.1701.05847,
  title  = {End-To-End Visual Speech Recognition With LSTMs},
  author = {Stavros Petridis and Zuwei Li and Maja Pantic},
  journal= {arXiv preprint arXiv:1701.05847},
  year   = {2017}
}

备注

Accepted for publication, ICASSP 2017