Prompt-CAM: 为细粒度分析使视觉Transformer可解释
计算机视觉与模式识别
2025-04-09 v2 人工智能
摘要
我们提出一种简单方法,使预训练的视觉Transformer(ViT)在细粒度分析中具有可解释性,旨在识别和局部化区分视觉上相似类别的特征,如鸟类种类。预训练的ViT(如DINO)在提取局部、判别性特征方面已显示出惊人的能力。然而,诸如Grad-CAM等显著图会失败识别这些特征,产生模糊、粗糙的热图,使其突出整个对象而非特征。我们提出了一种新方法,称为Prompt类注意力图(Prompt-CAM),以解决这一局限性。Prompt-CAM为预训练ViT学习类别特定的提示,并使用相应的输出进行分类。要正确分类图像,真实类别的提示必须注意图像中不属于其他类别图像的独特图像块(即特征)。因此,真实类别的多头注意力图揭示了特征及其位置。就实现而言,Prompt-CAM几乎是“免费的便餐”,仅需修改Visual Prompt Tuning(VPT)的预测头即可。这使得Prompt-CAM易于训练和应用,与其他需要设计特定模型和训练过程的可解释方法形成鲜明对比。广泛的实证研究在来自多个领域的数据集上(如鸟类、鱼类、昆虫、真菌、花卉、食物和汽车)验证了Prompt-CAM卓越的解释能力。源代码和演示可在https://github.com/Imageomics/Prompt_CAM上获取。
引用
@article{arxiv.2501.09333,
title = {Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis},
author = {Arpita Chowdhury and Dipanjyoti Paul and Zheda Mai and Jianyang Gu and Ziheng Zhang and Kazi Sajeed Mehrab and Elizabeth G. Campolongo and Daniel Rubenstein and Charles V. Stewart and Anuj Karpatne and Tanya Berger-Wolf and Yu Su and Wei-Lun Chao},
journal= {arXiv preprint arXiv:2501.09333},
year = {2025}
}
备注
Accepted by CVPR 2025 Main Conference