中文

用于视频中动作检测与分割的端到端三维卷积神经网络

计算机视觉与模式识别 2017-12-05 v1

摘要

本文中,我们提出一种用于视频中动作检测与分割的端到端 3D CNN。所提出的架构是一个统一的深度网络,能够基于 3D 卷积特征识别和定位动作。视频首先被划分为等长的片段,然后针对每个片段基于 3D CNN 特征生成一组管状提议。最后,不同片段的管状提议被连接在一起,并利用这些连接的视频提议进行时空动作检测。这种自顶向下的动作检测方法明确依赖于一组良好的管状提议才能表现良好,且训练边界框回归通常需要大量标注样本。为此,我们进一步将 3D CNN 扩展为编码器-解码器结构,并将定位问题表述为动作分割。每帧的前景区域(即动作区域)先被分割,然后利用分割出的前景图生成边界框。这种自底向上的方法通过利用分割的逐像素标注有效避免了管状提议生成。该分割框架也可轻易应用于视频目标分割这一一般问题。在多个视频数据集上的大量实验表明,我们的方法在动作检测和视频目标分割上相比当前最优(SOTA)方法具有更优性能。

关键词

引用

@article{arxiv.1712.01111,
  title  = {An End-to-end 3D Convolutional Neural Network for Action Detection and Segmentation in Videos},
  author = {Rui Hou and Chen Chen and Mubarak Shah},
  journal= {arXiv preprint arXiv:1712.01111},
  year   = {2017}
}

备注

arXiv admin note: substantial text overlap with arXiv:1703.10664