中文

Sparse R-CNN:基于可学习候选框的端到端目标检测

计算机视觉与模式识别 2021-04-27 v2

摘要

我们提出 Sparse R-CNN,一种用于图像目标检测的纯稀疏方法。现有的目标检测工作严重依赖稠密目标候选,例如在尺寸为 H×WH\times W 的图像特征图所有网格上预定义的 kk 个锚框。然而,在我们的方法中,提供一组固定稀疏的可学习目标候选(总长度为 NN)给目标识别头以执行分类与定位。通过将 HWkHWk(多达数十万)个手工设计的目标候选削减为 NN(如 100)个可学习候选,Sparse R-CNN 完全避免了与目标候选设计及一对多标签分配相关的所有工作。更重要的是,最终预测直接输出,无需非极大值抑制后处理。Sparse R-CNN 在具有挑战性的 COCO 数据集上展现出与成熟检测器基线相当的精度、运行时间与训练收敛性能,例如采用 ResNet-50 FPN 模型在标准 3×3\times 训练 schedule 下达到 45.0 AP 并以 22 fps 运行。我们希望我们的工作能启发对目标检测器中稠密先验惯例的重新思考。代码见:https://github.com/PeizeSun/SparseR-CNN。

关键词

引用

@article{arxiv.2011.12450,
  title  = {Sparse R-CNN: End-to-End Object Detection with Learnable Proposals},
  author = {Peize Sun and Rufeng Zhang and Yi Jiang and Tao Kong and Chenfeng Xu and Wei Zhan and Masayoshi Tomizuka and Lei Li and Zehuan Yuan and Changhu Wang and Ping Luo},
  journal= {arXiv preprint arXiv:2011.12450},
  year   = {2021}
}

备注

add test-dev; add crowdhuman