中文

面向小规模数据集的端到端视觉语音识别

计算机视觉与模式识别 2019-07-10 v4

摘要

视觉语音识别模型传统上由特征提取和分类两个阶段组成。近来提出了若干深度学习方法,旨在从嘴部图像中自动提取特征以替代特征提取阶段。然而,关于特征与分类联合学习的研究仍然有限。此外,大多数现有方法需要大量数据才能达到最先进性能,否则表现不佳。在本工作中,我们提出一种基于全连接层和长短期记忆(LSTM)网络的端到端视觉语音识别系统,适用于小规模数据集。该模型由两条流组成,分别从嘴部图像和差分图像中直接提取特征。每条流中的时间动态由双向LSTM(BLSTM)建模,两条流的融合通过另一个BLSTM实现。在OuluVS2、CUAVE、AVLetters和AVLetters2数据库上分别报告了相较最先进方法0.6%、3.4%、3.9%、11.4%的绝对提升。

关键词

引用

@article{arxiv.1904.01954,
  title  = {End-to-End Visual Speech Recognition for Small-Scale Datasets},
  author = {Stavros Petridis and Yujiang Wang and Pingchuan Ma and Zuwei Li and Maja Pantic},
  journal= {arXiv preprint arXiv:1904.01954},
  year   = {2019}
}

备注

Submitted to Pattern Recognition Letters