中文

通过任意概念解释: 具有开放词汇概念的概念瓶颈模型

计算机视觉与模式识别 2024-08-06 v1

摘要

概念瓶颈模型(CBottleneck Model, CBM)是一种以可解释为设计的框架,通过首先预测一组可解释概念,然后基于给定概念预测类别标签来做出决策。现有的CBM在封闭式世界假设下进行训练,概念要么来自数据集,要么从语言模型中查询。然而,这种封闭式假设在实际中不切实际,因为用户可能在模型部署后会对任何期望的概念在决策中的作用感兴趣。灵感来自CLIP等最近在零样本分类中取得成功的视觉语言预训练模型,我们提出了"OpenCBM"通过以下方式将开放词汇概念纳入CBM: (1)通过原型基于特征对齐,将可训练图像特征提取器的特征空间与CLIP图像编码器的特征空间对齐; (2)同时在下游数据集上训练图像分类器; (3)通过CLIP文本编码器编码的任何一组用户期望的文本概念来重构训练后的分类头。为揭示用户可能遗漏的概念,我们进一步提出在重构过程中迭代查找残差参数最接近的概念嵌入,直到残差足够小。据我们了解,OpenCBM是首个具有开放词汇概念的CBM,为用户提供了独特的优势,如在模型训练后删除、添加或替换任何期望的概念来解释模型的预测。此外,我们的模型在CUB-200-2011基准数据集上的分类准确率比以前的SOTA CBM高出9%。

关键词

引用

@article{arxiv.2408.02265,
  title  = {Explain via Any Concept: Concept Bottleneck Model with Open Vocabulary Concepts},
  author = {Andong Tan and Fengtao Zhou and Hao Chen},
  journal= {arXiv preprint arXiv:2408.02265},
  year   = {2024}
}

备注

ECCV2024