中文

视觉 Transformer 可视化:神经元传达什么信息以及神经元如何表现?

计算机视觉与模式识别 2022-10-19 v2 机器学习

摘要

近来视觉 Transformer(ViT)已成功应用于计算机视觉中的各类任务。然而,诸如其为何有效或如何表现等重要问题仍很大程度上未知。本文提出一种有效的可视化技术,以协助我们揭示 ViT 各层神经元与特征嵌入所携带的信息。我们的方法从 ViT 的计算过程出发,侧重于可视化输入图像中的局部与全局信息以及多层次的潜在特征嵌入。输入与第 0 层嵌入的可视化揭示了有趣发现,例如为 ViT 对图像遮挡与图像块乱序颇具鲁棒性提供支撑;或与 CNN 不同,第 0 层嵌入已携带丰富的语义细节。接下来,我们开发了一个严谨的框架以跨层进行有效可视化,揭示 ViT 滤波器的作用以及对物体图像块的分组/聚类行为。最后,我们在真实数据集上进行了全面实验,从定性与定量上证明我们所提方法的价值及我们的发现。https://github.com/byM1902/ViT_visualization

关键词

引用

@article{arxiv.2210.07646,
  title  = {Vision Transformer Visualization: What Neurons Tell and How Neurons Behave?},
  author = {Van-Anh Nguyen and Khanh Pham Dinh and Long Tung Vuong and Thanh-Toan Do and Quan Hung Tran and Dinh Phung and Trung Le},
  journal= {arXiv preprint arXiv:2210.07646},
  year   = {2022}
}

备注

The first two authors contributed equally to this work. Our code is available at https://github.com/byM1902/ViT_visualization