无 CLIP、无标签、无监督的概念瓶颈模型
计算机视觉与模式识别
2026-02-27 v4
摘要
概念瓶颈模型将密集特征表示映射为人类可理解的概念,然后将这些概念线性组合以进行预测。然而,现代 CBM 依赖 CLIP 模型来获取图像-概念标注,目前尚不清楚如何在没有 CLIP 瓶颈的情况下设计 CBM。不使用 CLIP 的方法转而需要人工的、劳动密集型的标注来将特征表示与概念关联。此外,所有 CBM 都需要训练一个线性分类器将提取的概念映射到类标签。在这项工作中,我们通过提出一种方法同时消除了这三个限制:该方法将任何冻结的视觉分类器转换为 CBM,无需图像-概念标签(无标签),不依赖 CLIP 模型(无 CLIP),并以无监督方式推导出线性分类器。我们的方法通过将原始分类器的分布(在离散类索引上)与其从文本类名导出的对应视觉-语言分布对齐,同时保持分类器的性能来构建。该方法不需要真实的图像-类标签,具有极高的数据效率,并保留了分类器的推理过程。在超过 40 个视觉分类器上应用和测试后,我们生成的无监督、无标签和无 CLIP 的 CBM (U-F-CBM) 创立了新的 SOTA,甚至超越了基于 CLIP 的有监督 CBM。我们还展示了我们的方法可用于零样本图像描述,优于基于 CLIP 的现有方法,并达到了 SOTA。
引用
@article{arxiv.2503.10981,
title = {CLIP-Free, Label Free, Unsupervised Concept Bottleneck Models},
author = {Fawaz Sammani and Jonas Fischer and Nikos Deligiannis},
journal= {arXiv preprint arXiv:2503.10981},
year = {2026}
}
备注
CVPR 2026 (Findings)