中文

面团何时变成百吉饼?分析 ImageNet 上残留的错误

计算机视觉与模式识别 2022-05-27 v2

摘要

过去十年中,ImageNet 数据集上的图像分类准确率一直是计算机视觉进展的晴雨表。近期的几篇论文质疑了该基准对社区是否仍具实用价值,然而创新仍在持续提升性能,当今最大的模型已实现 90%+ 的 top-1 准确率。为帮助厘清 ImageNet 上的进展并为当今最先进模型提供更有意义的评估,我们手动审查并归类了若干顶尖模型所犯的每个残留错误,以洞察这一计算机视觉中被基准测试最多的数据集上的错误长尾。我们聚焦于 ImageNet 的多标签子集评估,当今最佳模型在该子集上取得 97% 以上的 top-1 准确率。我们的分析显示,近一半所谓错误根本不是错误,并且我们发现了新的有效多标签,表明若不仔细审查,我们会显著低估这些模型的性能。另一方面,我们也发现当今最佳模型仍犯有大量(40%)对人类审查者而言明显错误的失误。为校准未来在 ImageNet 上的进展,我们提供了更新的多标签评估集,并策划了 ImageNet-Major:一个由当今顶尖模型所犯明显错误构成的 68 样本“重大错误”切片——在该切片上模型应近乎完美,但如今远未达到。

关键词

引用

@article{arxiv.2205.04596,
  title  = {When does dough become a bagel? Analyzing the remaining mistakes on ImageNet},
  author = {Vijay Vasudevan and Benjamin Caine and Raphael Gontijo-Lopes and Sara Fridovich-Keil and Rebecca Roelofs},
  journal= {arXiv preprint arXiv:2205.04596},
  year   = {2022}
}

备注

Data and analysis available at https://github.com/google-research/imagenet-mistakes