中文

InfoDisent:基于信息解耦的图像分类模型可解释性

计算机视觉与模式识别 2025-03-07 v2 人工智能

摘要

在这项工作中,我们介绍了 InfoDisent,一种基于信息瓶颈原理的混合可解释性方法。InfoDisent 能够将任何预训练模型最后一层中的信息解耦为原子概念,这些概念可以被解释为原型部件。该方法融合了事后方法的灵活性与自解释神经网络(如 ProtoPNet)的概念级建模能力。我们通过使用现代骨干网络(如 ViT 和卷积网络)在各种数据集上的计算实验和用户研究,展示了 InfoDisent 的有效性。值得注意的是,InfoDisent 将原型部件方法泛化到了新领域。

关键词

引用

@article{arxiv.2409.10329,
  title  = {InfoDisent: Explainability of Image Classification Models by Information Disentanglement},
  author = {Łukasz Struski and Dawid Rymarczyk and Jacek Tabor},
  journal= {arXiv preprint arXiv:2409.10329},
  year   = {2025}
}