中文

用于视频分类的表观与关系网络

计算机视觉与模式识别 2018-05-08 v2

摘要

视频中的时空特征学习是计算机视觉中的一个基本问题。本文提出一种称为表观与关系网络(ARTNet)的新架构,以端到端方式学习视频表示。ARTNet通过堆叠多个称为SMART的通用构建块来构造,其目标是分别以独立且显式的方式从RGB输入中同时建模表观和关系。具体而言,SMART块将时空学习模块解耦为用于空间建模的表观分支和用于时间建模的关系分支。表观分支基于每帧中像素或滤波器响应的线性组合实现,而关系分支基于多帧间像素或滤波器响应的乘性交互设计。我们在三个动作识别基准上进行了实验:Kinetics、UCF101和HMDB51,表明SMART块相比3D卷积在时空特征学习上获得了显著提升。在相同训练设置下,ARTNet在这三个数据集上取得了优于现有最先进方法的性能。

关键词

引用

@article{arxiv.1711.09125,
  title  = {Appearance-and-Relation Networks for Video Classification},
  author = {Limin Wang and Wei Li and Wen Li and Luc Van Gool},
  journal= {arXiv preprint arXiv:1711.09125},
  year   = {2018}
}

备注

CVPR18 camera-ready version. Code & models available at https://github.com/wanglimin/ARTNet