结合残差网络与LSTM进行唇读
计算机视觉与模式识别
2017-09-11 v4
摘要
我们提出了一种用于单词级视觉语音识别的端到端深度学习架构。该系统是时空卷积网络、残差网络与双向长短期记忆(Long Short-Term Memory)网络的组合。我们在Lipreading In-The-Wild基准上对其进行训练和评估,该基准是一个具有挑战性的数据库,包含500个目标词,由来自BBC电视广播的1.28秒视频片段组成。所提出的网络达到了83.0的单词准确率,比当前最先进水平绝对提升了6.8个百分点,且在训练或测试期间未使用单词边界信息。
引用
@article{arxiv.1703.04105,
title = {Combining Residual Networks with LSTMs for Lipreading},
author = {Themos Stafylakis and Georgios Tzimiropoulos},
journal= {arXiv preprint arXiv:1703.04105},
year = {2017}
}
备注
Submitted to Interspeech 2017