中文

利用图像级监督检测两万类别

计算机视觉与模式识别 2022-08-01 v3

摘要

当前目标检测器因检测数据集规模小而受限于词汇量大小。另一方面,图像分类器可推理大得多的词汇量,因其数据集更大且更易收集。我们提出 Detic,它简单地将检测器的分类器在图像分类数据上训练,从而将检测器的词汇量扩展到数万概念。与先前工作不同,Detic 不需要基于模型预测将图像标签分配给框的复杂指派方案,使其更易实现且兼容一系列检测架构与骨干网络。我们的结果表明,Detic 即使对无框标注的类别也能产出优异检测器。它在开放词汇与长尾检测基准上均优于先前工作。在开放词汇 LVIS 基准上,Detic 对所有类带来 2.4 mAP 提升,对新类带来 8.3 mAP 提升。在标准 LVIS 基准上,Detic 在所有类或仅稀有类上评估均获 41.7 mAP,从而缩小了少样本目标类别的性能差距。我们首次用 ImageNet 数据集全部两万一千类训练检测器,并展示其无需微调即可泛化到新数据集。代码见 \url{https://github.com/facebookresearch/Detic}。

关键词

引用

@article{arxiv.2201.02605,
  title  = {Detecting Twenty-thousand Classes using Image-level Supervision},
  author = {Xingyi Zhou and Rohit Girdhar and Armand Joulin and Philipp Krähenbühl and Ishan Misra},
  journal= {arXiv preprint arXiv:2201.02605},
  year   = {2022}
}

备注

ECCV 2022 camera ready. Code is available at https://github.com/facebookresearch/Detic