中文

LLM 与视觉语言模型在零样本单类分类中的应用

计算机视觉与模式识别 2024-05-28 v3 人工智能

摘要

我们考虑零样本单类视觉分类问题,将传统的单类分类扩展到仅可获得目标类别标签的场景。该方法旨在无需目标类别样本的情况下,区分正负查询样本。我们提出了一种两步解决方案:首先查询大型语言模型以获取视觉上易混淆的物体,然后依赖视觉语言预训练模型(如 CLIP)进行分类。通过适配大规模视觉基准,我们证明了所提出的方法在此设定下优于适配后的现成替代方案。具体而言,我们提出了一个现实基准,其中负查询样本与正查询样本抽取自同一原始数据集,包括一个粒度可控的 iNaturalist 版本,其中负样本在分类树中与正样本保持固定距离。据我们所知,我们是首个证明仅使用单个类别的标签即可将其与其他语义相关类别区分开来的研究。

关键词

引用

@article{arxiv.2404.00675,
  title  = {LLM meets Vision-Language Models for Zero-Shot One-Class Classification},
  author = {Yassir Bendou and Giulia Lioi and Bastien Pasdeloup and Lukas Mauch and Ghouthi Boukli Hacene and Fabien Cardinaux and Vincent Gripon},
  journal= {arXiv preprint arXiv:2404.00675},
  year   = {2024}
}