中文

PerceptionCLIP:通过推断并基于上下文进行条件化的视觉分类

计算机视觉与模式识别 2024-03-19 v3 人工智能 计算与语言 机器学习

摘要

像 CLIP 这样的视觉-语言模型因能够理解各种视觉概念和自然语言描述,被广泛应用于零样本图像分类。然而,如何充分利用 CLIP 前所未有的类人理解能力以获得更好性能仍是一个开放问题。本文从人类视觉感知过程获得启发:在对物体分类时,人类首先推断上下文属性(如背景和朝向),这有助于将前景物体与背景分离,然后基于该信息对物体进行分类。受此启发,我们观察到为 CLIP 提供上下文属性可改善零样本图像分类,并减轻对虚假特征的依赖。我们还观察到 CLIP 本身能够合理地从图像中推断这些属性。基于这些观察,我们提出了一种无需训练的两步零样本分类方法 PerceptionCLIP。给定一幅图像,它首先推断上下文属性(如背景),然后基于这些属性进行物体分类的条件化。我们的实验表明,PerceptionCLIP 实现了更好的泛化性、群体鲁棒性和可解释性。我们的代码可在 https://github.com/umd-huang-lab/perceptionCLIP 获取。

关键词

引用

@article{arxiv.2308.01313,
  title  = {PerceptionCLIP: Visual Classification by Inferring and Conditioning on Contexts},
  author = {Bang An and Sicheng Zhu and Michael-Andrei Panaitescu-Liess and Chaithanya Kumar Mummadi and Furong Huang},
  journal= {arXiv preprint arXiv:2308.01313},
  year   = {2024}
}

备注

Accepted by ICLR 2024