中文

单帧视频目标检测器

计算机视觉与模式识别 2020-07-08 v1

摘要

可能比两阶段检测器更快更简单的单阶段检测器往往更适用于视频中的目标检测。然而,此类目标检测器从图像到视频的扩展并非易事,尤其在视频中存在表观退化(如运动模糊或遮挡)时。一个合理的问题是:如何利用跨帧的时间相干性来提升检测。在本文中,我们提出通过聚合相邻帧来增强每帧特征以解决该问题。具体而言,我们提出单帧视频目标检测器(Single Shot Video Object Detector, SSVD)——一种将特征聚合新颖地集成到一阶段检测器中用于视频目标检测的新架构。在技术上,SSVD 以特征金字塔网络(Feature Pyramid Network, FPN)为骨干网络以生成多尺度特征。与现有特征聚合方法不同,SSVD 一方面估计运动并沿运动路径聚合邻近特征,另一方面在两流结构中通过直接从相邻帧采样特征来幻觉化特征。在 ImageNet VID 数据集上进行了大量实验,与最先进方法相比报告了有竞争力的结果。更值得注意的是,对于 448×448448 \times 448 输入,SSVD 在 Nvidia Titan X Pascal GPU 上以每帧 85 ms 的处理速度在 ImageNet VID 上达到 79.2% mAP。代码见 \url{https://github.com/ddjiajun/SSVD}。

关键词

引用

@article{arxiv.2007.03560,
  title  = {Single Shot Video Object Detector},
  author = {Jiajun Deng and Yingwei Pan and Ting Yao and Wengang Zhou and Houqiang Li and Tao Mei},
  journal= {arXiv preprint arXiv:2007.03560},
  year   = {2020}
}

备注

Accepted by IEEE Transactions on Multimedia; The code is available at \url{https://github.com/ddjiajun/SSVD}