重新思考目标检测从零训练
计算机视觉与模式识别
2021-06-08 v1
摘要
ImageNet 预训练初始化是目标检测的事实标准。He 等人发现可以从零训练(随机初始化)检测器,但需要更长的训练 schedule 配合适当的归一化技术。在本文中,我们探索直接在目标数据集上为目标检测进行预训练。在这种情况下,我们发现广泛采用的大尺寸缩放策略(例如将图像缩放到 (1333, 800))对微调很重要,但对预训练并非必要。具体而言,我们提出了一种遵循“预训练与微调”的目标检测新训练流程,利用目标数据集内的低分辨率图像预训练检测器,然后加载并以高分辨率图像微调。通过该策略,我们可以在预训练期间使用大批量大小的批量归一化(BN),并且内存高效,可应用于 GPU 内存非常有限(11G)的机器。我们称之为直接检测预训练,也简称直接预训练。实验结果表明,在 COCO 数据集上直接预训练比 ImageNet 预训练加速了 11 倍以上的预训练阶段,同时 mAP 甚至提升 +1.8。此外,我们发现直接预训练也适用于基于 transformer 的骨干网络,例如 Swin Transformer。代码将公开。
引用
@article{arxiv.2106.03112,
title = {Rethinking Training from Scratch for Object Detection},
author = {Yang Li and Hong Zhang and Yu Zhang},
journal= {arXiv preprint arXiv:2106.03112},
year = {2021}
}
备注
tech reports