中文

无处不在的伪特征——ImageNet 中有害伪特征的大规模检测

计算机视觉与模式识别 2023-08-24 v2 机器学习

摘要

深度学习分类器的基准性能本身并不能可靠地预测部署模型的性能。特别是,如果图像分类器在训练数据中习得了伪特征,其预测可能会以意想不到的方式失效。在本文中,我们开发了一个框架,使我们能够系统地识别像 ImageNet 这样的大型数据集中的伪特征。该框架基于我们的神经 PCA 分量及其可视化。以往关于伪特征的工作通常在玩具设定下运行,或需要代价高昂的逐像素标注。相比之下,我们基于 ImageNet 开展工作,并通过表明某一类有害伪特征单独存在即足以触发该类预测来验证我们的结果。我们引入了新颖的数据集“Spurious ImageNet”,它可用于衡量任何 ImageNet 分类器对有害伪特征的依赖程度。此外,我们提出 SpuFix 作为一种简单的缓解方法,可在不需要额外标签或重新训练模型的情况下,降低任何 ImageNet 分类器对先前识别出的有害伪特征的依赖。我们在 https://github.com/YanNeu/spurious_imagenet 提供了代码和数据。

关键词

引用

@article{arxiv.2212.04871,
  title  = {Spurious Features Everywhere -- Large-Scale Detection of Harmful Spurious Features in ImageNet},
  author = {Yannic Neuhaus and Maximilian Augustin and Valentyn Boreiko and Matthias Hein},
  journal= {arXiv preprint arXiv:2212.04871},
  year   = {2023}
}

备注

accepted to ICCV 2023