SALISA:基于显著性的输入采样用于高效视频目标检测
计算机视觉与模式识别
2022-04-06 v1
摘要
高分辨率图像被广泛采用以实现视频中高性能的目标检测。然而,处理高分辨率输入会带来高昂的计算成本,而朴素地下采样输入以降低计算成本会迅速降低检测性能。本文提出 SALISA,一种新颖的基于非均匀显著性(SALiency-based)的输入采样(Input SAmpling)技术,用于视频目标检测,该技术可对不重要的背景区域进行重度下采样,同时保留高分辨率图像的细粒度细节。所得图像空间尺寸更小,从而降低计算成本,同时实现与高分辨率输入相媲美的性能。为此,我们提出一种基于薄板样条空间变换网络(TPS-STN)的可微重采样模块。该模块由一种新颖的损失正则化,以提供显式监督信号来学习“放大”显著区域。我们在 ImageNet-VID 和 UA-DETRAC 视频目标检测数据集的低计算量场景下报告了最先进(state-of-the-art)的结果。我们证明,在这两个数据集上,EfficientDet-D1(EfficientDet-D2)的 mAP 以低得多的计算成本达到了与 EfficientDet-D2(EfficientDet-D3)相当的水平。我们还表明 SALISA 显著改善了小目标的检测。特别地,采用 EfficientDet-D1 检测器的 SALISA 将小目标检测提升了 ,并且显著优于 EfficientDet-D3 基线。
引用
@article{arxiv.2204.02397,
title = {SALISA: Saliency-based Input Sampling for Efficient Video Object Detection},
author = {Babak Ehteshami Bejnordi and Amirhossein Habibian and Fatih Porikli and Amir Ghodrati},
journal= {arXiv preprint arXiv:2204.02397},
year = {2022}
}
备注
20 pages, 7 figures