中文

解锁 ImageNet 的多目标本质:自动大规模多标签标注

计算机视觉与模式识别 2026-03-09 v1

摘要

原始 ImageNet 基准强制执行单标签假设,尽管许多图像描绘了多个对象。这导致标签噪声,限制了学习信号的丰富性。多标签标注更准确地反映真实视觉场景,其中多个对象共存并贡献于语义理解,从而使模型能够学习更丰富、更稳健的表征。虽然已有 prior 工作(如 ReaL、ImageNetv2)改进了验证集,但尚未存在针对训练集的可扩展、高质量多标签标注。为此,我们提出了一个无需人工标注的自动化管道,将 ImageNet 训练集转换为多标签数据集。利用自监督 Vision Transformer,我们进行无监督目标发现,选取与原始标签对齐的区域以训练轻量级分类器,并将其应用于所有区域,以生成数据集上的连贯多标签标注。我们的标签在定性评估中与人类判断一致,且在定量基准测试中始终显著提升性能。与传统单标签方案相比,使用我们多标签监督训练的模型在不同架构下在原地准确性方面 consistently 获得更好成绩(在 ReaL 上提升最高达 +2.0 的 top-1 准确率,在 ImageNet-V2 上提升 +1.5),并在下游任务的可迁移性方面表现更强(在 COCO 和 VOC 上分别实现最高提升 +4.2 和 +2.3 的 mAP)。这些结果凸显了准确多标签标注对增强分类性能和表征学习的重要性。项目代码和生成的多标签标注均可在 https://github.com/jchen175/MultiLabel-ImageNet 上获取。

关键词

引用

@article{arxiv.2603.05729,
  title  = {Unlocking ImageNet's Multi-Object Nature: Automated Large-Scale Multilabel Annotation},
  author = {Junyu Chen and Md Yousuf Harun and Christopher Kanan},
  journal= {arXiv preprint arXiv:2603.05729},
  year   = {2026}
}

备注

Accepted to CVPR 2026 Findings