中文

端到端多视角唇读

计算机视觉与模式识别 2017-09-05 v1

摘要

非正面唇部视图包含有用信息,可用于增强正面视角唇读的性能。然而,绝大多数近期的唇读工作,包括显著优于传统方法的深度学习方法,都集中于正面嘴部图像。因此,关于从多视角联合学习视觉特征和语音分类的研究十分有限。在本工作中,我们提出了一种基于双向长短期记忆(BLSTM)网络的端到端多视角唇读系统。据我们所知,这是首个同时学习直接从像素提取特征、从多视角执行视觉语音分类并达到最先进性能的模型。该模型由多个相同的流组成,每个视角一个流,直接从不同姿态的嘴部图像中提取特征。每个流/视角中的时间动态由 BLSTM 建模,而多个流/视角的融合则通过另一个 BLSTM 实现。在 OuluVS2 数据库上的结果显示,当结合最佳的两个视角(正面和侧面)以及三个视角(正面、侧面、45 度)时,相较于单一正面视角性能分别实现了 3% 和 3.8% 的绝对平均提升。最佳的三视角模型在 OuluVS2 上相较于当前多视角最先进性能实现了 10.5% 的绝对提升,且未使用外部数据库进行训练,最高分类准确率达到 96.9%。

关键词

引用

@article{arxiv.1709.00443,
  title  = {End-to-End Multi-View Lipreading},
  author = {Stavros Petridis and Yujiang Wang and Zuwei Li and Maja Pantic},
  journal= {arXiv preprint arXiv:1709.00443},
  year   = {2017}
}

备注

Accepted to BMVC 2017