中文

基于管状候选网络的视频目标检测

计算机视觉与模式识别 2018-01-10 v2

摘要

随着大规模 ImageNet VID 数据集的引入,视频中的目标检测近期引起了越来越多的关注。与静态图像中的目标检测不同,视频中的时间信息对于目标检测至关重要。为了充分利用时间信息,现有最先进的方法基于时空管状体,其本质上是跨时间关联的边界框序列。然而,现有方法在生成管状体的质量和效率方面存在主要局限性。基于运动的方法能够高效地获取密集的管状体,但其长度通常只有几帧,不利于融入长期时间信息。基于外观的方法通常涉及通用目标跟踪,可以生成较长的管状体,但通常计算成本高昂。在这项工作中,我们提出了一个用于视频中目标检测的框架,该框架由一个用于高效生成时空候选区域的新型管状候选网络,以及一个从管状候选区域中融合时间信息以在视频中实现高目标检测精度的长短期记忆(LSTM)网络组成。在大规模 ImageNet VID 数据集上的实验证明了所提出框架在视频目标检测中的有效性。

关键词

引用

@article{arxiv.1702.06355,
  title  = {Object Detection in Videos with Tubelet Proposal Networks},
  author = {Kai Kang and Hongsheng Li and Tong Xiao and Wanli Ouyang and Junjie Yan and Xihui Liu and Xiaogang Wang},
  journal= {arXiv preprint arXiv:1702.06355},
  year   = {2018}
}

备注

CVPR 2017