面向视觉模型行为的基于概念的溯因与对比解释
机器学习
2026-05-08 v1 人工智能
摘要
*基于概念的解释* 提供了一种有前景的方法,可以用高级的、人类可理解的概念来解释深度神经网络的预测。然而,现有方法要么没有建立概念与模型预测之间的因果联系,要么在表达能力上受限,只能推断涉及单一概念的因果解释。与此同时,*形式化溯因与对比解释* 的平行工作计算了对模型结果具有因果相关性的最小输入特征集,但仅考虑了像素等低级特征。融合这两条主线,在这项工作中,我们提出了 *基于概念的溯因与对比解释* 的概念,用于捕捉对模型结果具有因果相关性的最小高级概念集。然后,我们提出了一族算法,在使用 *概念擦除* 程序建立因果关系的同时枚举所有最小解释。通过适当地聚合此类解释,我们不仅能够理解模型对单个图像的预测,还能理解模型表现出用户指定的共同 *行为* 的图像集合上的预测。我们在多个模型、数据集和行为上评估了我们的方法,并证明了其在计算有用且用户友好的解释方面的有效性。
引用
@article{arxiv.2605.06640,
title = {Concept-Based Abductive and Contrastive Explanations for Behaviors of Vision Models},
author = {Ronaldo Canizales and Divya Gopinath and Corina Păsăreanu and Ravi Mangal},
journal= {arXiv preprint arXiv:2605.06640},
year = {2026}
}