ViT-CX:视觉 Transformer 的因果解释
计算机视觉与模式识别
2023-06-12 v3 人工智能
摘要
尽管 Vision Transformers(ViTs)和可解释 AI(XAI)广受欢迎,迄今为止仅有少数解释方法专为 ViTs 设计。它们大多使用 [CLS] 令牌对图像块嵌入的注意力权重,且常产生不令人满意的显著图。本文提出一种称为 ViT-CX 的 ViT 解释新方法。它基于图像块嵌入而非对其的注意力,以及它们对模型输出的因果影响。ViTs 的其他特性(如因果过度决定)也在 ViT-CX 的设计中被考虑。实证结果表明,与先前方法相比,ViT-CX 产生更有意义的显著图,并更好地揭示了预测的所有重要证据。ViT-CX 生成的解释也显示出显著更好的对模型的忠实性。代码与附录可在 https://github.com/vaynexie/CausalX-ViT 获取。
引用
@article{arxiv.2211.03064,
title = {ViT-CX: Causal Explanation of Vision Transformers},
author = {Weiyan Xie and Xiao-Hui Li and Caleb Chen Cao and Nevin L. Zhang},
journal= {arXiv preprint arXiv:2211.03064},
year = {2023}
}
备注
IJCAI2023 Camera-ready