VISION DIFFMASK:用可微分斑块掩码对视觉Transformer进行忠实解释
计算机视觉与模式识别
2023-04-14 v1 人工智能
机器学习
摘要
尽管Vision Transformer有效,但其缺乏可解释性可能阻碍其在关键现实应用中的使用。为克服该问题,我们提出一种称为VISION DIFFMASK的事后可解释性方法,其利用模型隐藏层的激活来预测对最终预测有贡献的输入相关部分。我们的方法使用门控机制来识别保留类上预测分布的最小原始输入子集。我们通过引入忠实性任务,并在CIFAR-10和ImageNet-1K上与其他最先进的归因方法比较,证明了方法的忠实性,取得了引人注目的结果。为便于复现和进一步扩展我们的工作,我们开源了实现:https://github.com/AngelosNal/Vision-DiffMask
引用
@article{arxiv.2304.06391,
title = {VISION DIFFMASK: Faithful Interpretation of Vision Transformers with Differentiable Patch Masking},
author = {Angelos Nalmpantis and Apostolos Panagiotopoulos and John Gkountouras and Konstantinos Papakostas and Wilker Aziz},
journal= {arXiv preprint arXiv:2304.06391},
year = {2023}
}
备注
Accepted in the XAI4CV Workshop at CVPR 2023