中文

ImageNet-X:利用变异因素标注理解模型错误

计算机视觉与模式识别 2022-11-04 v1 机器学习

摘要

深度学习视觉系统被广泛部署于可靠性至关重要的应用中。然而,即便当今最佳的模型,在物体姿态、光照或背景变化时也可能无法识别该物体。尽管现有基准测试暴露出对模型而言具有挑战性的样本,它们并未解释此类错误因何产生。为满足这一需求,我们引入 ImageNet-X,其对整个 ImageNet-1k 验证集以及 12k 张训练图像的随机子集给出了姿态、背景或光照等十六种因素的人工标注。借助 ImageNet-X,我们调研了 2,200 个当前识别模型,并研究了错误类型随模型(1)架构(如 transformer 与卷积)、(2)学习范式(如监督与自监督)、(3)训练流程(如数据增强)的变化情况。无论这些选择如何,我们发现模型在 ImageNet-X 各类别上具有一致的错误模式。我们还发现,尽管数据增强可提升对某些因素的鲁棒性,却会对其他因素引发溢出效应。例如,强随机裁剪损害了针对较小物体的鲁棒性。综上,这些见解表明,要提升现代视觉模型的鲁棒性,未来研究应聚焦于收集额外数据和理解数据增强方案。连同这些见解,我们发布了一个基于 ImageNet-X 的工具包,以推动对图像识别系统所犯错误的进一步研究。

关键词

引用

@article{arxiv.2211.01866,
  title  = {ImageNet-X: Understanding Model Mistakes with Factor of Variation Annotations},
  author = {Badr Youbi Idrissi and Diane Bouchacourt and Randall Balestriero and Ivan Evtimov and Caner Hazirbas and Nicolas Ballas and Pascal Vincent and Michal Drozdzal and David Lopez-Paz and Mark Ibrahim},
  journal= {arXiv preprint arXiv:2211.01866},
  year   = {2022}
}