基于深度监督的从零训练目标检测器
计算机视觉与模式识别
2019-03-20 v2
摘要
我们提出了深度监督目标检测器(DSOD),一种可以从零开始训练的目标检测框架。近期目标检测的进展严重依赖于在 ImageNet 和 OpenImage 等大规模分类数据集上预训练的现成模型。然而,一个问题是将分类任务的预训练模型用于检测任务时,由于目标函数不同以及物体类别的分布差异,可能会引入学习偏置。像在检测任务上微调这样的技术可以在一定程度上缓解该问题,但本质上仍不彻底。此外,将这些预训练模型跨差异较大的领域迁移会更加困难(例如从 RGB 到深度图像)。因此,处理这些关键问题的更好方案是从零训练目标检测器,这也促使了我们提出该方法。此前该方向上的尝试主要因训练数据有限以及用于目标检测的主干网络结构过于简单而失败。在 DSOD 中,我们提出了一套从零学习目标检测器的设计原则。其中一个关键原则是深度监督,通过主干网络和预测层中的逐层密集连接实现,在从零学习良好检测器中起着关键作用。结合若干其他原则后,我们基于单发检测框架(SSD)构建了 DSOD。我们在 PASCAL VOC 2007、2012 和 COCO 数据集上评估了我们的方法。DSOD 以更紧凑的模型一致地取得了优于最先进方法的结果。具体而言,DSOD 在所有三个基准上都优于基线方法 SSD,而仅需其 1/2 的参数。我们还观察到,DSOD 仅使用 1/3 的参数,且无需额外数据或预训练模型,即可取得与 Mask RCNN + FPN(在相似输入尺寸下)相当或略好的结果。
引用
@article{arxiv.1809.09294,
title = {Object Detection from Scratch with Deep Supervision},
author = {Zhiqiang Shen and Zhuang Liu and Jianguo Li and Yu-Gang Jiang and Yurong Chen and Xiangyang Xue},
journal= {arXiv preprint arXiv:1809.09294},
year = {2019}
}
备注
More results and analysis in this version. This is an extension of our previous conference paper: arXiv:1708.01241