Show and Tell:通过基于空间的概念瓶颈模型实现可视可解释的深度神经网络
计算机视觉与模式识别
2025-09-23 v4
摘要
现代深度神经网络已在各种任务中达到人类水平,但与人类不同,它们缺乏通过显示位置和说明何种概念指导其决策的能力。本 work 提出了一个统一框架,用于将任何视觉神经网络转换为空间和概念可解释的模型。我们引入一种基于空间的概念瓶颈层,将预训练 backbone 模型的“黑箱”特征投射到可解释的概念图中,而无需人工标签。通过在该瓶颈上训练分类层,可获得自我解释模型,能够阐明哪些概念最影响其预测,并生成将概念在输入图像中定位的热图。因此,我们将此方法命名为“空间感知且无标签概念瓶颈模型” (SALF-CBM)。我们的结果表明,所提出的 SALF-CBM: (1) 在各种分类任务中超越非空间 CBM 方法以及原始 backbone 模型; (2) 在零样本分割任务中生成高质量的空间解释,优于广泛使用的热图方法; (3) 促进模型探索和调试,使用户能够查询特定图像区域并通过局部编辑其概念图来细化模型决策。
引用
@article{arxiv.2502.20134,
title = {Show and Tell: Visually Explainable Deep Neural Nets via Spatially-Aware Concept Bottleneck Models},
author = {Itay Benou and Tammy Riklin-Raviv},
journal= {arXiv preprint arXiv:2502.20134},
year = {2025}
}