中文

AutoFocus:高效多尺度推理

计算机视觉与模式识别 2019-08-02 v2

摘要

本文描述了AutoFocus,一种基于深度学习的物体检测器的高效多尺度推理算法。AutoFocus不处理整个图像金字塔,而是采用由粗到精的策略,仅在更精细尺度上处理可能包含小物体的区域。这是通过在较粗尺度上预测类别无关的、称为FocusPixels的小物体分割图实现的。FocusPixels可以以高召回率预测,且在许多情况下仅覆盖图像的一小部分。为高效利用FocusPixels,提出了一种生成紧凑矩形FocusChips以包围FocusPixels的算法。检测器仅应用于FocusChips内部,从而在更精细尺度处理时减少计算量。当合并多尺度FocusChips的检测结果时会产生不同类型的误差,因此提出了修正技术。AutoFocus在COCO test-dev集上获得47.9%的mAP(50%重叠时为68.3%),同时在Titan X (Pascal) GPU上以每秒6.4张图像的速度处理。这比我们的多尺度基线检测器快2.5倍,且mAP相当。金字塔中处理的像素数可减少5倍,而mAP仅下降1%。与RetinaNet相比,AutoFocus获得超过10%的mAP提升,但在相同ResNet-101骨干下以相同速度运行。

关键词

引用

@article{arxiv.1812.01600,
  title  = {AutoFocus: Efficient Multi-Scale Inference},
  author = {Mahyar Najibi and Bharat Singh and Larry S. Davis},
  journal= {arXiv preprint arXiv:1812.01600},
  year   = {2019}
}

备注

To appear in Proceedings of International Conference on Computer Vision (ICCV), 2019