ProtoPFormer:在视觉 Transformer 中聚焦原型部件以实现可解释图像识别
计算机视觉与模式识别
2025-11-27 v3 人工智能
摘要
原型部件网络(ProtoPNet)因其对可解释人工智能(XAI)的自解释特性而受到广泛关注,并推动了诸多后续研究。然而,当直接将 ProtoPNet 应用于视觉 Transformer(ViT)骨干网络时,所学到的原型存在“分心”问题:它们被背景激活的概率相对较高,而对前景的关注较少。对长程依赖建模的强大能力使得基于 Transformer 的 ProtoPNet 难以聚焦于原型部件,从而严重损害其固有的可解释性。本文提出原型部件 Transformer(ProtoPFormer),以恰当且有效地将基于原型的方法与 ViT 结合用于可解释图像识别。所提方法根据 ViT 的架构特点引入全局与局部原型,以捕获并突出目标具有代表性的整体与局部特征。全局原型用于提供物体的全局视图,引导局部原型聚焦于前景并消除背景影响。随后,局部原型被显式监督以集中于各自对应的原型视觉部件,提升整体可解释性。大量实验表明,我们所提出的全局与局部原型能够相互纠正并共同做出最终决策,分别从整体与局部视角忠实且透明地关联推理决策过程。此外,ProtoPFormer 在性能与可视化结果上持续优于最先进的(SOTA)基于原型的基线方法。我们的代码已发布于 https://github.com/zju-vipa/ProtoPFormer。
引用
@article{arxiv.2208.10431,
title = {ProtoPFormer: Concentrating on Prototypical Parts in Vision Transformers for Interpretable Image Recognition},
author = {Mengqi Xue and Qihan Huang and Haofei Zhang and Jingwen Hu and Jie Song and Mingli Song and Canghong Jin},
journal= {arXiv preprint arXiv:2208.10431},
year = {2025}
}
备注
Arxiv preprint; 18 pages, 12 figures, 7 tables