基于卷积神经网络的视频管段目标检测
计算机视觉与模式识别
2017-03-07 v1
摘要
深度卷积神经网络(CNNs)在各种视觉任务如图像分类、目标检测和语义分割中展现了令人印象深刻的性能。对于目标检测,尤其在静态图像中,由于强大的深度网络(如 GoogleNet)和检测框架(如基于 CNN 特征的区域(R-CNN)),去年性能显著提升。最近引入的 ImageNet 视频目标检测(VID)任务将目标检测任务带入视频领域,其中要求用边界框标注每帧中物体的位置。本工作中,我们引入一个基于静态图像目标检测和通用目标跟踪的 VID 任务完整框架。它们在 VID 任务中的关系与贡献被深入研究和评估。此外,提出一种时间卷积网络以融合时间信息来正则化检测结果,并展示了其对该任务的有效性。
引用
@article{arxiv.1604.04053,
title = {Object Detection from Video Tubelets with Convolutional Neural Networks},
author = {Kai Kang and Wanli Ouyang and Hongsheng Li and Xiaogang Wang},
journal= {arXiv preprint arXiv:1604.04053},
year = {2017}
}
备注
Accepted in CVPR 2016 as a Spotlight paper