通过概念解释 CLIP 零样本预测
计算机视觉与模式识别
2026-03-31 v1
摘要
大规模视觉语言模型如CLIP在零样本图像识别方面取得了显著成功,但其预测对人类理解仍然难以把握。相比之下,概念瓶颈模型通过推理人类定义的概念来提供可解释的中间表示,但依赖概念监督且无法泛化到未见类别。我们引入EZPC,通过人类可理解的概念解释CLIP的零样本预测。该方法将CLIP的联合图像-文本嵌入投影到从语言描述中学习的概念空间中,无需额外监督即可实现对CLIP语义结构的忠实保留和透明解释。模型通过对齐与重构目标的组合学习该投影,确保概念激活保留了CLIP的语义结构同时具有可解释性。在CIFAR-100、CUB-200-2011、Places365、ImageNet-100和ImageNet-1k等五个基准数据集上进行大量实验,表明该方法在保持CLIP强大的零样本分类准确性的同时,提供了有意义的概念层次解释。通过将开放词汇预测锚定在显式语义概念上,我们的方法为通向可解释可信的视觉语言模型提供了原则性方法。代码可在 https://github.com/oonat/ezpc 获取。
引用
@article{arxiv.2603.28211,
title = {Explaining CLIP Zero-shot Predictions Through Concepts},
author = {Onat Ozdemir and Anders Christensen and Stephan Alaniz and Zeynep Akata and Emre Akbas},
journal= {arXiv preprint arXiv:2603.28211},
year = {2026}
}
备注
Accepted to CVPR 2026