中文

可视化与理解视觉Transformer中的图像块交互

计算机视觉与模式识别 2022-03-14 v1

摘要

视觉 Transformer(ViT)已成为各种计算机视觉任务中的领先工具,这归功于其独特的自注意力机制,该机制通过跨图像块信息交互显式地学习视觉表示。尽管取得了良好成功,文献中很少探讨视觉 Transformer 的可解释性,且对于涉及全面图像块间相关性的注意力机制将如何影响性能及其进一步潜力尚缺乏清晰认识。本工作中,我们提出一种新颖的可解释可视化方法,以分析和解释视觉 Transformer 中图像块间的关键注意力交互。具体而言,我们首先引入一个量化指标来衡量图像块交互的影响,并在注意力窗口设计与无判别性图像块移除上验证该量化。然后,我们利用 ViT 中每个图像块的有效响应域并据此设计了一种无窗口 Transformer 架构。在 ImageNet 上的大量实验表明,精心设计的量化方法能够促进 ViT 模型学习,最多带来 4.28% 的 top-1 准确率提升。此外,在下游细粒度识别任务上的结果进一步验证了我们所提方法的泛化性。

关键词

引用

@article{arxiv.2203.05922,
  title  = {Visualizing and Understanding Patch Interactions in Vision Transformer},
  author = {Jie Ma and Yalong Bai and Bineng Zhong and Wei Zhang and Ting Yao and Tao Mei},
  journal= {arXiv preprint arXiv:2203.05922},
  year   = {2022}
}

备注

15 pages, 14 figures