中文

ECOR:用于目标识别的可解释 CLIP

计算机视觉与模式识别 2024-04-22 v1 人工智能 机器学习

摘要

大型视觉语言模型(VLMs),如 CLIP,为包括目标识别和目标检测在内的各种计算机视觉任务做出了重要贡献。其开放词汇特征提升了其价值。然而,其黑盒性质和预测缺乏可解释性使其在关键领域中的可信度降低。最近,一些工作致力于迫使 VLMs 为目标识别提供合理的依据,但这通常以牺牲分类精度为代价。在本文中,我们首先基于类别和依据的联合概率分布,提出了目标识别任务中可解释性的数学定义,然后利用该定义以可解释的方式微调 CLIP。通过对不同数据集的评估,我们的方法在可解释分类中展示了 SOTA 性能。值得注意的是,它在零样本设置中表现出色,展示了其适应性。这一进展改进了可解释目标识别,增强了跨各种应用的信任。代码将在发表后在线提供。

关键词

引用

@article{arxiv.2404.12839,
  title  = {ECOR: Explainable CLIP for Object Recognition},
  author = {Ali Rasekh and Sepehr Kazemi Ranjbar and Milad Heidari and Wolfgang Nejdl},
  journal= {arXiv preprint arXiv:2404.12839},
  year   = {2024}
}