评估大词汇表目标检测器:细节决定成败
计算机视觉与模式识别
2022-03-16 v2
摘要
从设计上看,目标检测的平均精度(AP)旨在独立对待所有类别:AP 按类别独立计算后取平均。一方面,这是可取的,因为它平等对待所有类别。另一方面,它忽略了跨类别置信度校准,而这是真实应用场景中的关键属性。遗憾的是,在重要条件下(即大词汇表、高实例数),AP 的默认实现既非类别独立,也不能直接奖励经过恰当校准的检测器。事实上,我们表明在 LVIS 上默认实现产生了一种可被钻空子的指标,其中简单、不直观的重排序策略可大幅提升 AP。为应对这些局限,我们引入两个互补指标。首先,我们对默认 AP 实现给出简单修正,确保其如最初意图般跨类别独立。我们对近期 LVIS 检测进展进行基准测试,发现许多报告增益在我们的新评估下并未转化为改进,表明近期改进可能源于难以解释的跨类别排序变化。鉴于可靠基准测试跨类别排序的重要性,我们考虑 AP 的池化版本(AP-Pool),通过直接比较跨类别排序来奖励恰当校准的检测器。最后,我们重访经典校准方法,发现显式校准检测器在 AP-Pool 上将最先进水平提升 1.7 个点。
引用
@article{arxiv.2102.01066,
title = {Evaluating Large-Vocabulary Object Detectors: The Devil is in the Details},
author = {Achal Dave and Piotr Dollár and Deva Ramanan and Alexander Kirillov and Ross Girshick},
journal= {arXiv preprint arXiv:2102.01066},
year = {2022}
}