中文

RN-VID:一种用于视频目标检测的特征融合架构

计算机视觉与模式识别 2020-04-03 v2

摘要

视频中的连续帧具有高度冗余性。因此,为执行视频目标检测任务,对每一帧不加复用地执行单帧检测器是相当浪费的。正是基于这一想法,我们提出 RN-VID (意为 RetinaNet-VIDeo),一种视频目标检测的新方法。我们的贡献有两点。首先,我们提出一种新架构,允许利用邻近帧的信息来增强特征图。其次,我们提出一种新模块,通过通道重排与 1 x 1 卷积来融合同维特征图。随后我们证明,RN-VID 以极小的额外推理成本取得了优于相应单帧检测器的平均精度均值 (mAP)。

关键词

引用

@article{arxiv.2003.10898,
  title  = {RN-VID: A Feature Fusion Architecture for Video Object Detection},
  author = {Hughes Perreault and Maguelonne Héritier and Pierre Gravel and Guillaume-Alexandre Bilodeau and Nicolas Saunier},
  journal= {arXiv preprint arXiv:2003.10898},
  year   = {2020}
}