中文

Context R-CNN:用于单相机目标检测的长期时间上下文

计算机视觉与模式识别 2020-04-24 v3 机器学习 图像与视频处理 种群与进化

摘要

在静态监控摄像头中,有用的上下文信息可以远超典型视频理解模型所能看到的几秒钟:目标可能在多天内表现出相似行为,且背景物体保持静止。由于功耗和存储限制,采样频率较低,通常不超过每秒一帧,且有时因使用运动触发而不规则。为了在此场景下表现良好,模型必须对不规则采样率具有鲁棒性。本文提出一种方法,利用来自新摄像头未标注帧的时间上下文来提升该摄像头上的性能。具体而言,我们提出一种基于注意力的方法,使我们的模型Context R-CNN能够索引到基于每摄像头构建的长期记忆库,并聚合来自其他帧的上下文特征以提升当前帧的目标检测性能。我们将Context R-CNN应用于两种设置:(1)使用相机陷阱的物种检测,以及(2)交通摄像头中的车辆检测,并在两种设置中均显示Context R-CNN相较强基线取得了性能提升。此外,我们表明增加上下文时间范围可带来改进结果。当应用于来自Snapshot Serengeti数据集的相机陷阱数据时,具有长达一个月图像上下文的Context R-CNN相较单帧基线提升了17.9% mAP,并相较S3D(基于3D卷积的基线)提升了11.2% mAP。

关键词

引用

@article{arxiv.1912.03538,
  title  = {Context R-CNN: Long Term Temporal Context for Per-Camera Object Detection},
  author = {Sara Beery and Guanhang Wu and Vivek Rathod and Ronny Votel and Jonathan Huang},
  journal= {arXiv preprint arXiv:1912.03538},
  year   = {2020}
}

备注

CVPR 2020