利用深度卷积 LSTM 网络从视频中学习
计算机视觉与模式识别
2019-04-10 v1 机器学习
摘要
本文探索使用卷积 LSTM 同时学习视频中的空间与时间信息。深度卷积 LSTM 网络使模型能够在数据的所有空间尺度上访问全部时间信息范围。我们描述了涉及卷积 LSTM 用于唇读的实验,表明该模型能够选择性地选择对特定数据集最相关的时空尺度。所提出的深度架构在其他时空特征起关键作用的应用中也具前景,而无需专门针对问题中存在的特定时空特征来定制网络设计。对于 Lip Reading in the Wild (LRW) 数据集,我们的模型略优于先前的最优结果(83.4% 对比 83.0%),并在模型于 Lip Reading Sentences (LRS2) 数据集上预训练时以 85.2% 刷新最优纪录。
引用
@article{arxiv.1904.04817,
title = {Learning from Videos with Deep Convolutional LSTM Networks},
author = {Logan Courtney and Ramavarapu Sreenivas},
journal= {arXiv preprint arXiv:1904.04817},
year = {2019}
}