学习用视觉 Transformer 估计 Shapley 值
计算机视觉与模式识别
2023-03-03 v3 机器学习
摘要
Transformer 已成为计算机视觉中的默认架构,但理解其预测背后的驱动因素仍是一个具有挑战性的问题。当前的解释方法依赖于注意力值或输入梯度,但这些仅提供了模型依赖关系的有限视角。Shapley 值提供了一种理论上严谨的替代方案,但其计算代价使得它们对于大型高维模型而言不切实际。在本工作中,我们旨在使 Shapley 值对视觉 Transformer(ViT)实用化。为此,我们首先利用注意力掩码方法以部分信息评估 ViT,随后开发了一种通过独立的、可学习的解释器模型生成 Shapley 值解释的流程。我们的实验将 Shapley 值与许多基线方法(如注意力回传、GradCAM、LRP)进行比较,发现我们的方法为 ViT 提供了比现有方法更准确的解释。
引用
@article{arxiv.2206.05282,
title = {Learning to Estimate Shapley Values with Vision Transformers},
author = {Ian Covert and Chanwoo Kim and Su-In Lee},
journal= {arXiv preprint arXiv:2206.05282},
year = {2023}
}
备注
ICLR 2023 camera-ready