中文

填补空缺:一种评估视觉Transformer解释方法的新框架

计算机视觉与模式识别 2024-06-18 v1

摘要

扰动测试仍然是计算机视觉中解释方法的首选评估方式。这种评估方法有一个主要缺点,即由于像素掩蔽导致的测试时分布偏移,而这种偏移在训练集中并不存在。为了克服这一缺点,我们提出了一种名为\textbf{填补空缺(InG)}的新评估框架。具体来说,我们提出对构成图像中部分或完整对象的区域进行修复。通过这种方式,可以在测试时分布偏移较小的情况下进行有意义的图像扰动,从而提高扰动测试的有效性。InG被应用于PartImageNet数据集,以评估视觉Transformer(ViT)三种训练策略下流行解释方法的性能。基于此评估,我们发现Beyond Intuition和Generic Attribution是两个最一致的解释模型。此外,有趣的是,所提出的框架在本文考虑的所有ViT模型上均产生了更高且更一致的评估分数。据我们所知,InG是首个用于评估ViT解释方法的半合成框架。

关键词

引用

@article{arxiv.2406.11534,
  title  = {Inpainting the Gaps: A Novel Framework for Evaluating Explanation Methods in Vision Transformers},
  author = {Lokesh Badisa and Sumohana S. Channappayya},
  journal= {arXiv preprint arXiv:2406.11534},
  year   = {2024}
}