中文

用于目标检测的带自动聚焦的尺度归一化图像金字塔

计算机视觉与模式识别 2021-02-11 v1 人工智能

摘要

我们提出一种高效的中央凹框架来执行目标检测。生成尺度归一化图像金字塔(SNIP),其如同人类视觉,仅关注不同尺度下固定尺寸范围内的物体。这种训练期间对物体尺寸的限制有利于更好地学习对物体敏感的滤波器,从而带来更好精度。然而,使用图像金字塔增加了计算成本。因此,我们提出一种高效的空间子采样方案,仅对可能含物体的固定尺寸子区域进行操作(因训练时物体位置已知)。所得方法称为带高效重采样的尺度归一化图像金字塔或 SNIPER,在训练时实现高达 3 倍加速。遗憾的是,由于推理时物体位置未知,仍须处理整个图像金字塔。为此,我们采用由粗到精的方法,预测类物体区域的位置与范围,以便在图像金字塔的连续尺度中处理。直观上,这类似于我们的主动人类视觉:先扫视视野以发现有趣区域作进一步处理,并仅在正确分辨率下识别物体。所得算法称为 AutoFocus,与 SNIP 结合在推理时实现 2.5-5 倍加速。

关键词

引用

@article{arxiv.2102.05646,
  title  = {Scale Normalized Image Pyramids with AutoFocus for Object Detection},
  author = {Bharat Singh and Mahyar Najibi and Abhishek Sharma and Larry S. Davis},
  journal= {arXiv preprint arXiv:2102.05646},
  year   = {2021}
}

备注

Accepted in T-PAMI 2021