中文

单标签假设对图像识别基准的影响

计算机视觉与模式识别 2025-05-29 v2

摘要

深度神经网络 (DNN) 通常在每个图像只有一个正确标签的假设下进行评估。然而,许多基准数据集中的图像(如 ImageNet)包含多个有效标签,这导致评估协议与视觉数据的实际复杂度之间存在偏差。这种偏差可能会对预测正确但未被标注的标签进行惩罚,这部分解释了如此被广泛引用的 ImageNetV2 上 top-1 准确率下降约 11% 到 14% 的现象。ImageNetV2 是 ImageNet 的一个复制测试集。这引出了一个问题:这些下降是否反映出真正的泛化失败,还是受限制评估指标的制造 Artifact 的结果?我们对单标签评估对报告准确性差距的影响进行了严格的评估。为评估单标签训练模型的多标签预测能力 (MLPC),我们引入了可变 top-kk 评估,其中 kk 匹配每个图像的有效标签数量。应用于 315 个训练自 ImageNet 的模型后,我们的分析表明,常规的 top-1 准确率对有效但次要预测进行了不成比例的惩罚。我们还提出 Aggregate Subgroup Model Accuracy (ASMA) 以更好地捕捉模型子组之间的多标签性能。我们的结果显示,MLPC 存在很大的差异,其中一些模型在排名多个正确标签方面表现一致。在这种评估下,ImageNet 与 ImageNetV2 之间的感知差距大幅缩小。为进一步隔离多标签识别性能与上下文线索,我们引入 PatchML,这是一个包含系统性组合对象块的人工合成数据集。PatchML 表明,许多是以单标签监督训练的模型仍然能够识别多个对象。总体而言,这些发现凸显了单标签评估的局限性,并表明现代 DNN 的多标签能力远超标准指标所暗示的范围。

关键词

引用

@article{arxiv.2412.18409,
  title  = {The Impact of the Single-Label Assumption in Image Recognition Benchmarking},
  author = {Esla Timothy Anzaku and Seyed Amir Mousavi and Arnout Van Messem and Wesley De Neve},
  journal= {arXiv preprint arXiv:2412.18409},
  year   = {2025}
}

备注

34 pages, 7 figures