CLIP遇DINO:使用无标签图像集合调优零样本分类器
计算机视觉与模式识别
2025-04-11 v3 计算与语言
机器学习
摘要
在基础模型时代,CLIP已成为强大的工具,用于将文本与视觉模态对齐到常见的嵌入空间中。然而,CLIP使用的对齐目标往往导致在细粒度任务上表现不佳的视觉特征。相比之下,基于自监督学习的模型如DINO因其专门的训练范式而在提取丰富视觉特征方面表现更佳。然而,这些自监督模型需要额外的监督线性探针步骤,而这需要大量标注数据,在规模化应用中往往昂贵且难以获取。在本文中,我们提出了一种无标签提示调优方法,利用自监督学习模型(DINO)的丰富视觉特征以及大型语言模型(LLM)的广泛文本知识,大大提升基于CLIP的图像分类性能。我们的 метод包含三个关键步骤:(1)我们生成更准确地表示对象类别的稳健文本特征嵌入,利用LLM提供的类别特定描述,实现比CLIP默认名称特定提示更有效的零样本分类。(2)这些文本嵌入被用于生成伪标签,以训练一个对齐模块,将LLM描述驱动的文本嵌入与DINO视觉特征的互补优势相结合。(3)最后,我们通过DINO辅助的监督对CLIP的视觉编码器进行提示调优。这个三个步骤的过程使我们能够发挥视觉与文本基础模型的最佳优势, resulting in a powerful and efficient approach that surpasses state-of-the-art label-free classification methods. 值得注意的是,我们的框架NoLA(No Labels Attached)在11个多样化图像分类数据集上平均超过当前最先进方法LaFTer提升了3.6个百分点。我们的代码与模型可在https://github.com/fazliimam/NoLA 查找。
引用
@article{arxiv.2411.19346,
title = {CLIP meets DINO for Tuning Zero-Shot Classifier using Unlabeled Image Collections},
author = {Mohamed Fazli Imam and Rufael Fedaku Marew and Jameel Hassan and Mustansar Fiaz and Alham Fikri Aji and Hisham Cholakkal},
journal= {arXiv preprint arXiv:2411.19346},
year = {2025}
}