中文

VideoLSTM:用于动作识别的卷积、注意力与运动流

计算机视觉与模式识别 2016-07-08 v1

摘要

我们提出了一种用于视频中动作端到端序列学习的新架构,称为 VideoLSTM。我们不是使视频去适应已有循环或卷积架构的特性,而是调整架构以契合视频媒体的需求。从软注意力 LSTM (soft-Attention LSTM) 出发,VideoLSTM 做出了三点新颖贡献。首先,视频具有空间布局。为利用空间相关性,我们在软注意力 LSTM 架构中硬连接卷积操作。其次,运动不仅告知我们动作内容,还更好地引导注意力朝向相关的时空位置。我们引入了基于运动的注意力 (motion-based attention)。最后,我们展示了如何仅依靠动作类别标签,利用 VideoLSTM 的注意力来实现动作定位。在具有挑战性的动作分类与定位数据集上的实验与比较支持了我们的主张。

关键词

引用

@article{arxiv.1607.01794,
  title  = {VideoLSTM Convolves, Attends and Flows for Action Recognition},
  author = {Zhenyang Li and Efstratios Gavves and Mihir Jain and Cees G. M. Snoek},
  journal= {arXiv preprint arXiv:1607.01794},
  year   = {2016}
}