ViT-ReciproCAM:面向视觉 Transformer 的无梯度无注意力视觉解释方法
计算机视觉与模式识别
2023-10-05 v1 机器学习
摘要
本文提出一种新方法,以解决理解 Vision Transformer (ViT) 预测过程及调试预测误差的挑战;ViT 已在图像分类与目标检测等多种计算机视觉任务中展现出优越性能。尽管诸如 CAM、Grad-CAM、Score-CAM 与 Recipro-CAM 等若干视觉可解释性技术已针对卷积神经网络(CNN)被广泛研究,针对 ViT 的研究仍十分有限。当前 ViT 的最优方案依赖于类别无关的 Attention-Rollout 与 Relevance 技术。本工作中,我们提出一种面向 ViT 的新型无梯度视觉解释方法,称为 ViT-ReciproCAM,其无需注意力矩阵与梯度信息。ViT-ReciproCAM 利用令牌掩码并从目标层输入生成新层输出,以利用激活令牌与针对目标类别的网络预测之间的关联。我们提出的方法在 Average Drop-Coherence-Complexity (ADCC) 指标上以 至 的优势优于最优的 Relevance 方法,并生成更具局部性的显著图。我们的实验证明了 ViT-ReciproCAM 的有效性,并展示了其在理解与调试 ViT 模型方面的潜力。我们提出的方法提供了一种高效且易于实现的视觉解释生成替代方案,无需注意力与梯度信息,可有益于计算机视觉领域的多种应用。
引用
@article{arxiv.2310.02588,
title = {ViT-ReciproCAM: Gradient and Attention-Free Visual Explanations for Vision Transformer},
author = {Seok-Yong Byun and Wonju Lee},
journal= {arXiv preprint arXiv:2310.02588},
year = {2023}
}