中文

T-CNN:用于视频目标检测的管状片段与卷积神经网络

计算机视觉与模式识别 2018-01-10 v4

摘要

过去两年,目标检测的最优性能已显著提升。除了引入如 GoogleNet 和 VGG 等强大的深度神经网络,新颖的目标检测框架如 R-CNN 及其后继者 Fast R-CNN 和 Faster R-CNN 在提升最优性能方面起着至关重要的作用。尽管这些框架在静态图像上有效,但它们并非专为视频中的目标检测而设计。视频的时间和上下文信息未被充分研究和利用。在本工作中,我们提出一种深度学习框架,整合从视频中获取的管状片段(tubelets)的时间和上下文信息,当现有静态图像检测框架应用于视频时,其基线性能得到显著改善。该框架称为 T-CNN,即 tubelets with convolutional neural networks(基于卷积神经网络的管状片段)。所提框架在最近引入的 ImageNet 大规模视觉识别挑战赛 2015 (ILSVRC2015) 中提供的视频目标检测 (VID) 任务上获胜。

关键词

引用

@article{arxiv.1604.02532,
  title  = {T-CNN: Tubelets with Convolutional Neural Networks for Object Detection from Videos},
  author = {Kai Kang and Hongsheng Li and Junjie Yan and Xingyu Zeng and Bin Yang and Tong Xiao and Cong Zhang and Zhe Wang and Ruohui Wang and Xiaogang Wang and Wanli Ouyang},
  journal= {arXiv preprint arXiv:1604.02532},
  year   = {2018}
}

备注

ImageNet 2015 VID challenge tech report. The first two authors share co-first authorship. Accepted as a Transaction paper by T-CSVT Special Issue on Large Scale and Nonlinear Similarity Learning for Intelligent Video Analysis