中文

结合残差网络与LSTM进行唇读

计算机视觉与模式识别 2017-09-11 v4

摘要

我们提出了一种用于单词级视觉语音识别的端到端深度学习架构。该系统是时空卷积网络、残差网络与双向长短期记忆(Long Short-Term Memory)网络的组合。我们在Lipreading In-The-Wild基准上对其进行训练和评估,该基准是一个具有挑战性的数据库,包含500个目标词,由来自BBC电视广播的1.28秒视频片段组成。所提出的网络达到了83.0的单词准确率,比当前最先进水平绝对提升了6.8个百分点,且在训练或测试期间未使用单词边界信息。

关键词

引用

@article{arxiv.1703.04105,
  title  = {Combining Residual Networks with LSTMs for Lipreading},
  author = {Themos Stafylakis and Georgios Tzimiropoulos},
  journal= {arXiv preprint arXiv:1703.04105},
  year   = {2017}
}

备注

Submitted to Interspeech 2017