你最好再看一眼:以新视角设计低计算量高精度检测器
计算机视觉与模式识别
2021-08-04 v2
摘要
通用目标检测器使用强大的骨干网络从图像中均匀提取特征,以检测海量对象类别。然而,在为特定对象类别开发的目标检测应用中,此类骨干网络会不必要地对大量背景进行过处理。此外,它们对对象尺度不敏感,从而以相同分辨率冗余地处理所有图像区域。本工作中,我们提出 BLT-net,一种新型低计算量两阶段目标检测架构,旨在处理含大量背景与多尺度对象的图像。BLT-net 通过极轻量的一阶段将对象从背景中分离,从而减少计算量。随后 BLT-net 高效合并所得候选框以进一步降低被处理背景,并动态降低其分辨率以最小化计算。所得图像候选区域再由高精度的二阶段模型处理。我们在行人检测问题上展示我们的架构:其中对象尺寸各异、图像分辨率高且要求实时检测。我们表明,相较于领先行人检测器,在 Citypersons 与 Caltech 数据集上我们的设计以微小精度下降为代价,将计算量降低了 x4-x7 倍。该方法可应用于其他具有可观背景与多变对象尺寸场景中的目标检测应用,以减少计算量。
引用
@article{arxiv.2107.10050,
title = {You Better Look Twice: a new perspective for designing accurate detectors with reduced computations},
author = {Alexandra Dana and Maor Shutman and Yotam Perlitz and Ran Vitek and Tomer Peleg and Roy J Jevnisek},
journal= {arXiv preprint arXiv:2107.10050},
year = {2021}
}