中文

FaCT:基于概念轨迹的可信解释框架

机器学习 2026-04-15 v2 人工智能 计算机视觉与模式识别

摘要

深度网络在广泛的任务中展现出卓越的性能,但从概念层面理解其工作方式仍是关键挑战。许多基于后置概念的方法被引入以理解其工作原理,但它们在忠实性方面始终不够。此外,这些方法对模型学习的概念施加了限制性假设,如类别特定性、小空间范围或与人类期望的一致性。在本工作中,我们强调概念解释的忠实性,提出一种具有模型内在机制的概念解释模型。我们的概念跨越多个类别,从任意层追踪其对 logit 及其输入可视化的贡献。我们还利用基础模型提出一种新的概念一致性指标 C²-Score,用于评估概念方法。我们表明,与先前工作相比,我们的概念在定量上更具一致性,用户认为我们的概念更具可解释性,同时保持了与 ImageNet 相当的性能。

关键词

引用

@article{arxiv.2510.25512,
  title  = {FaCT: Faithful Concept Traces for Explaining Neural Network Decisions},
  author = {Amin Parchami-Araghi and Sukrut Rao and Jonas Fischer and Bernt Schiele},
  journal= {arXiv preprint arXiv:2510.25512},
  year   = {2026}
}

备注

35 pages, 23 figures, 2 tables, Neural Information Processing Systems (NeurIPS) 2025; Code is available at https://github.com/m-parchami/FaCT