基于标签传播的视觉-语言模型零样本分类
计算机视觉与模式识别
2024-04-08 v1 机器学习
摘要
视觉-语言模型(VLM)在零样本分类(即仅提供类别名称列表时的分类)中展现了令人瞩目的性能。本文处理存在未标注数据情况下的零样本分类问题。我们利用未标注数据的图结构,引入ZLaP,一种基于标签传播(LP)的方法,该方法利用测地距离进行分类。我们将LP定制为包含文本和图像特征的图,并进一步提出一种基于对偶解和稀疏化步骤的高效归纳推理方法。我们进行了大量实验,在14个常见数据集上评估了我们方法的有效性,并表明ZLaP优于最新的相关工作。代码:https://github.com/vladan-stojnic/ZLaP
引用
@article{arxiv.2404.04072,
title = {Label Propagation for Zero-shot Classification with Vision-Language Models},
author = {Vladan Stojnić and Yannis Kalantidis and Giorgos Tolias},
journal= {arXiv preprint arXiv:2404.04072},
year = {2024}
}
备注
CVPR 2024