中文

EPIC:基于原型的预训练图像分类网络解释方法

计算机视觉与模式识别 2025-05-20 v1

摘要

可解释人工智能(Explainable AI, XAI)方法通常分为两类。事后方法(post-hoc)为预训练模型生成解释,兼容多种神经网络架构。这些方法常使用特征重要性可视化(如显著图)来指示模型预测受哪些输入区域影响。然而,这些方法通常只能提供对模型决策过程的粗浅理解。相反,内在可解释方法(ante-hoc)依赖专用模型架构,从头训练模型。原型类方法取代表征性数据块(prototypes)作为解释,提取自训练数据。然而,原型方法存在局限:需要专用架构、涉及专业训练流程,且仅在特定数据集上表现良好。本文提出EPIC(Explanation of Pretrained Image Classification),一种新方法,弥合上述两种方法之间的差距。EPIC类似事后方法,无需修改模型架构即可运行;同时,采用受内在可解释方法启发的原型解释,提供直观易懂的解释。迄今为止,EPIC是首个能够完全复制内在可解释模型核心解释能力的事后方法。我们在常用于原型解释的基准数据集(如CUB-200-2011和Stanford Cars)以及大规模数据集(如ImageNet)上进行评估。EPIC使用原型解释模型决策,为创建清晰、高质量解释提供了灵活且易于理解的工具。

关键词

引用

@article{arxiv.2505.12897,
  title  = {EPIC: Explanation of Pretrained Image Classification Networks via Prototype},
  author = {Piotr Borycki and Magdalena Trędowicz and Szymon Janusz and Jacek Tabor and Przemysław Spurek and Arkadiusz Lewicki and Łukasz Struski},
  journal= {arXiv preprint arXiv:2505.12897},
  year   = {2025}
}