中文

注意力引导的 CAM:由自注意力引导的 Vision Transformer 视觉解释

计算机视觉与模式识别 2024-02-08 v1 人工智能

摘要

Vision Transformer(ViT)因其在各种任务上的出色性能,成为计算机视觉领域使用最广泛的模型之一。为了在各种应用中充分利用基于 ViT 的架构,需要具有良好定位性能的适当可视化方法,但由于其独特的结构,这些在基于 CNN 的模型中使用的方法在 ViT 中仍然不可用。在这项工作中,我们提出了一种应用于 ViT 的注意力引导可视化方法,为其决策提供高级语义解释。我们的方法选择性地聚合直接从分类输出传播到每个自注意力的梯度,收集从输入图像每个位置提取的图像特征的贡献。这些梯度还由归一化的自注意力分数(即成对 patch 相关性分数)引导。它们用于补充由自注意力机制有效检测到的 patch 级上下文信息上的梯度。我们方法的这种途径仅使用类标签即可提供具有出色定位性能的精细高级语义解释。因此,我们的方法在弱监督定位任务中优于以往领先的 ViT 可解释性方法,并在捕获目标类对象的所有实例方面展现出强大的能力。同时,我们的方法提供了忠实解释模型的可视化,这在扰动对比测试中得到了证明。

关键词

引用

@article{arxiv.2402.04563,
  title  = {Attention Guided CAM: Visual Explanations of Vision Transformer Guided by Self-Attention},
  author = {Saebom Leem and Hyunseok Seo},
  journal= {arXiv preprint arXiv:2402.04563},
  year   = {2024}
}

备注

AAAI2024. Code available at https://github.com/LeemSaebom/Attention-Guided-CAM-Visual-Explanations-of-Vision-Transformer-Guided-by-Self-Attention.git