中文

基于自适应原型 Vision Transformer 的可解释图像分类

计算机视觉与模式识别 2025-09-11 v1

摘要

我们提出了 ProtoViT,一种结合深度学习与基于案例推理的可解释图像分类方法。该方法通过将图像与一组学习到的原型进行比较来对其进行分类,提供“这看起来像那”形式的解释。在我们的模型中,原型由若干部分(parts)组成,这些部分可以在不规则几何结构上发生形变,从而在图像间实现更好的比较。与依赖卷积神经网络(CNN)主干和空间刚性原型的现有模型不同,我们的模型将 Vision Transformer(ViT)主干集成到基于原型的模型中,同时提供空间形变原型,这些原型不仅能适应物体的几何变化,还能以自适应的原型部分数量提供连贯且清晰的原型特征表示。我们的实验表明,我们的模型通常能取得比现有基于原型的模型更高的性能。我们的全面分析确保了原型的一致性和解释的忠实性。

关键词

引用

@article{arxiv.2410.20722,
  title  = {Interpretable Image Classification with Adaptive Prototype-based Vision Transformers},
  author = {Chiyu Ma and Jon Donnelly and Wenjun Liu and Soroush Vosoughi and Cynthia Rudin and Chaofan Chen},
  journal= {arXiv preprint arXiv:2410.20722},
  year   = {2025}
}