基于加权相关性累积的通用注意力模型可解释性
计算机视觉与模式识别
2023-08-22 v1
摘要
基于注意力的 transformer 模型在多模态任务(如视觉问答)中取得了显著进展。基于注意力方法的可解释性近来广受关注,因为它可通过跨注意力层累积相关性来解释注意力 token 的内部变化。现有方法简单地通过等权累积注意力过程前后 token 相关性来更新相关性。然而,在相关性累积过程中 token 值的重要性通常不同。本文中,我们提出一种加权相关性策略,考虑 token 值的重要性,以减少等权累积相关性时的失真。为评估我们的方法,我们提出一个统一的基于 CLIP 的两阶段模型,名为 CLIPmapper,通过 CLIP 编码器及后续 mapper 处理视觉与语言任务。CLIPmapper 由自注意力、交叉注意力、单模态与跨模态注意力组成,因此更适于评估我们的通用可解释性方法。在视觉问答与图像描述上的大量扰动测试验证了我们的可解释性方法优于现有方法。
引用
@article{arxiv.2308.10240,
title = {Generic Attention-model Explainability by Weighted Relevance Accumulation},
author = {Yiming Huang and Aozhe Jia and Xiaodan Zhang and Jiawei Zhang},
journal= {arXiv preprint arXiv:2308.10240},
year = {2023}
}