Pack and Detect:利用感兴趣区域打包实现视频中快速目标检测
计算机视觉与模式识别
2024-07-18 v5 机器学习
摘要
视频中的目标检测是计算机视觉中一项重要任务,应用于目标跟踪、视频摘要和视频搜索等多种场景。尽管近年来由于深度神经网络的兴起,目标检测精度取得了巨大进展,但最先进的算法计算量高度密集。为应对这一挑战,我们在视频背景下提出两个重要观察:(i)物体通常仅占每帧视频画面的一小部分面积;(ii)连续帧之间存在高度的时间相关性可能。基于这些观察,我们提出Pack and Detect(PaD),一种降低视频目标检测计算需求的方法。在PaD中,仅以原始尺寸处理称为锚帧的选定视频帧。在锚帧之间的帧(锚间帧)中,根据前一帧的检测结果确定感兴趣区域(ROI)。我们提出一种算法将每个锚间帧的ROI打包到一个缩小尺寸的帧中。由于输入尺寸变小,检测器的计算需求得以降低。为保持目标检测精度,所提算法以贪心方式扩展ROI,为检测器提供每个物体周围的额外背景。PaD可使用任何底层神经网络架构来处理原始尺寸和缩小尺寸的帧。使用ImageNet视频目标检测数据集的实验表明,PaD有可能将每帧所需FLOPS减少。这在2.1 GHz Intel Xeon服务器配NVIDIA Titan X GPU上以精度下降为代价,使整体吞吐量提升。
引用
@article{arxiv.1809.01701,
title = {Pack and Detect: Fast Object Detection in Videos Using Region-of-Interest Packing},
author = {Athindran Ramesh Kumar and Balaraman Ravindran and Anand Raghunathan},
journal= {arXiv preprint arXiv:1809.01701},
year = {2024}
}
备注
Proceedings of the ACM India Joint International Conference on Data Science and Management of Data. 2019