SNIPER:高效多尺度训练
计算机视觉与模式识别
2018-12-14 v3
摘要
我们提出 SNIPER,一种在实例级视觉识别任务中执行高效多尺度训练的算法。SNIPER 不处理图像金字塔中的每个像素,而是在适当尺度下处理真实实例周围的上下文区域(称为 chips)。对于背景采样,这些上下文区域使用以短学习 schedule 训练的区域提议网络提取的提议来生成。因此,训练时每幅图像生成的 chips 数量根据场景复杂度自适应变化。在 COCO 数据集上,SNIPER 仅比常用的 800x1333 像素单尺度训练多处理 30% 的像素,但它也观察到图像金字塔极端分辨率(如 1400x2000 像素)下的样本。由于 SNIPER 操作于重采样的低分辨率 chips (512x512 像素),即使使用 ResNet-101 骨干,在单 GPU 上也能有高达 20 的批大小。因此,它可以在训练时受益于批归一化,而无需跨 GPU 同步批归一化统计量。SNIPER 使目标检测等实例级识别任务的训练更接近于图像分类的流程,并提示通常认为的“为实例级视觉识别任务必须在高分辨率图像上训练”的准则可能并不正确。我们基于 Faster-RCNN 与 ResNet-101 骨干的实现在 COCO 数据集上获得 47.6% 边界框检测 mAP,并在单 GPU 推理时每秒处理 5 幅图像。代码见 https://github.com/MahyarNajibi/SNIPER/。
引用
@article{arxiv.1805.09300,
title = {SNIPER: Efficient Multi-Scale Training},
author = {Bharat Singh and Mahyar Najibi and Larry S. Davis},
journal= {arXiv preprint arXiv:1805.09300},
year = {2018}
}
备注
Presented at the NIPS 2018 conference