中文

Token 变换至关重要:面向视觉 Transformer 的忠实事后解释

计算机视觉与模式识别 2024-03-22 v1

摘要

尽管 Transformer 在各种计算机视觉应用中迅速普及,但对其内部机制的事后解释在很大程度上仍未得到探索。视觉 Transformer 通过将图像区域表示为变换后的 token 并通过注意力权重整合它们来提取视觉信息。然而,现有的事后解释方法仅考虑这些注意力权重,忽略了来自变换后 token 的关键信息,从而未能准确阐明模型预测背后的依据。为了将 token 变换的影响纳入解释,我们提出了 TokenTM,一种利用我们引入的 token 变换效应测量方法的新型事后解释方法。具体来说,我们通过测量变换前后 token 长度的变化及其方向上的相关性来量化 token 变换效应。此外,我们制定了初始化和聚合规则,以整合所有层的注意力权重和 token 变换效应,捕获整个模型中整体的 token 贡献。在分割和扰动测试上的实验结果证明了我们提出的 TokenTM 相较于最先进的视觉 Transformer 解释方法的优越性。

关键词

引用

@article{arxiv.2403.14552,
  title  = {Token Transformation Matters: Towards Faithful Post-hoc Explanation for Vision Transformer},
  author = {Junyi Wu and Bin Duan and Weitai Kang and Hao Tang and Yan Yan},
  journal= {arXiv preprint arXiv:2403.14552},
  year   = {2024}
}

备注

CVPR 2024