G-RCN:优化目标检测中分类与定位任务间的差异
计算机视觉与模式识别
2020-12-08 v1
摘要
多任务学习在计算机视觉中被广泛使用。当前,目标检测模型利用共享特征图同时完成分类与定位任务。通过比较原始 Faster R-CNN 与部分分离特征图版本的性能,我们表明:(1) 为分类和定位任务共享高层特征是次优的;(2) 大步长有益于分类但有害于定位;(3) 全局上下文信息可提升分类性能。基于这些发现,我们提出了一种称为差距优化基于区域卷积网络(G-RCN)的范式,旨在分离这两个任务并优化它们之间的差距。该范式首先通过简单地减小步长并将 Conv5 块从检测头移至特征提取网络来修正当前的 ResNet 协议,这为 ResNet50 在 PASCAL VOC 数据集上带来 3.6 的 AP70 提升以及在 COCO 数据集上带来 1.5 的 AP 提升。接着,新方法应用于以 VGG16、ResNet50 和 ResNet101 为骨干网络的 Faster R-CNN,在 PASCAL VOC 数据集上带来超过 2.0 的 AP70 提升,在 COCO 数据集上带来超过 1.9 的 AP 提升。值得注意的是,G-RCN 的实现仅涉及少量结构修改,未添加额外模块。
引用
@article{arxiv.2012.03677,
title = {G-RCN: Optimizing the Gap between Classification and Localization Tasks for Object Detection},
author = {Yufan Luo and Li Xiao},
journal= {arXiv preprint arXiv:2012.03677},
year = {2020}
}