中文

过解释揭示图像分类模型的病理现象

机器学习 2021-12-08 v3 计算机视觉与模式识别 机器学习

摘要

图像分类器通常以其测试集准确率来评分,但高准确率可能掩盖一种微妙的错误类型。我们发现,在流行基准上得分高的卷积神经网络(CNNs)表现出令人不安的病理现象,使它们即使在缺乏语义显著特征时也能展现高准确率。当模型在缺乏显著支撑性输入特征的情况下给出高置信度决策时,我们称该分类器对其输入进行了过解释,在 humans 看来毫无意义的模式中找到了过多的类别证据。在此,我们证明在 CIFAR-10 和 ImageNet 上训练的神经网络存在过解释,并且我们发现 CIFAR-10 上的模型即使在 95% 的输入图像被掩码、人类无法在剩余像素子集中辨别显著特征时,仍能做出自信预测。我们引入批处理梯度 SIS(Batched Gradient SIS),一种用于发现复杂数据集充分输入子集的新方法,并用此方法展示了 ImageNet 中边界像素在训练与测试中的充分性。尽管这些模式预示着真实世界部署中潜在的模型脆弱性,它们事实上是基准的有效统计模式,仅凭其自身就足以获得高测试准确率。与对抗样本不同,过解释依赖于未修改的图像像素。我们发现集成与输入丢弃均可有助于缓解过解释。

关键词

引用

@article{arxiv.2003.08907,
  title  = {Overinterpretation reveals image classification model pathologies},
  author = {Brandon Carter and Siddhartha Jain and Jonas Mueller and David Gifford},
  journal= {arXiv preprint arXiv:2003.08907},
  year   = {2021}
}

备注

NeurIPS 2021