衡量概念基解释的(不)忠实性
机器学习
2026-03-31 v4 人工智能
计算机视觉与模式识别
摘要
深度视觉模型执行的输入输出计算难以解释。概念基解释方法(CBEM)通过以人类可理解的语义单元或概念重新表达模型的部分内容,从而提高可解释性。检查所得解释是否忠实——即是否代表模型内部计算——需要一个结合概念以计算输出的替代方案。为提高可解释性所做的简化不可避免地降低忠实性,导致两者之间存在权衡。最先进的无监督 CBEM(U-CBEM)看似更具可解释性,同时也更忠实于模型。然而,我们观察到所报告的忠实性提升实际上是由于(1)使用过于复杂的替代方案,导致解释可解释性代价未被衡量,或(2)依赖删除基方法,我们证明这并未正确衡量忠实性。我们提出了替代方案忠实性(SURF),其(1)用简单线性替代方案取代先前复杂的替代方案,在不改变解释可解释性的前提下衡量忠实性,(2)引入衡量所有输出类别损失的合理指标,而不仅仅是预测类别。我们通过提出一个简单 sanity check 来验证 SURF:即使用随机概念的解释应较不忠实,而先前的替代方案未能通过此检查。SURF 使许多在视觉上引人注目的 U-CBEM 首次获得可靠的忠实性基准,揭示其实际并不忠实。代码已发布于 https://github.com/skumar-ml/surf-eval。
引用
@article{arxiv.2504.10833,
title = {Measuring the (Un)Faithfulness of Concept-Based Explanations},
author = {Shubham Kumar and Narendra Ahuja},
journal= {arXiv preprint arXiv:2504.10833},
year = {2026}
}
备注
To appear in CVPR 2026