用于视频中动作检测的管卷积神经网络(T-CNN)
计算机视觉与模式识别
2017-08-03 v3
摘要
深度学习已在图像分类和目标检测中取得了优异的结果。然而,由于视频数据的复杂性和标注的缺乏,深度学习对视频分析(如动作检测和识别)的影响一直受限。以往基于卷积神经网络(CNN)的视频动作检测方法通常包含两个主要步骤:帧级动作候选检测和跨帧候选关联。此外,这些方法采用双流 CNN 框架分别处理空间和时间特征。在本文中,我们提出了一种名为管卷积神经网络(T-CNN)的端到端深度网络,用于视频中的动作检测。所提出的架构是一个统一网络,能够基于 3D 卷积特征识别和定位动作。视频首先被划分为等长的片段,接着基于 3D 卷积网络(ConvNet)特征为每个片段生成一组管候选。最后,利用网络流将不同片段的管候选链接在一起,并使用这些链接的视频候选执行时空动作检测。在多个视频数据集上的大量实验表明,与现有最优方法相比,T-CNN 在修剪和未修剪视频中动作的分类和定位方面均具有卓越的性能。
引用
@article{arxiv.1703.10664,
title = {Tube Convolutional Neural Network (T-CNN) for Action Detection in Videos},
author = {Rui Hou and Chen Chen and Mubarak Shah},
journal= {arXiv preprint arXiv:1703.10664},
year = {2017}
}