TLAC:用于零样本分类的两阶段 LMM 增强 CLIP
计算机视觉与模式识别
2025-04-22 v2
摘要
对比语言-图像预训练(CLIP)在图像分类上展示了令人印象深刻的零样本性能。然而,最先进的方法通常依赖微调技术(如提示学习和适配器微调)来优化 CLIP 的性能。对微调的需求显著限制了 CLIP 对新数据集和领域的适应能力。这一要求为每个新数据集 mandates 大量时间和计算资源。为克服这一限制,我们引入了简单而有效的无需训练的方案——单阶段 LMM 增强 CLIP(SLAC)和两阶段 LMM 增强 CLIP(TLAC),利用强大的大多模态模型(LMM),如 Gemini,进行图像分类。所提出的方法利用预训练 LMM 的能力,无需额外训练即可无缝适应多样化的数据集和领域。我们的方法包括提示 LMM 识别图像中的对象。随后,CLIP 文本编码器通过识别与 LLM 预测对象语义相似度最高的数据集类别来确定图像类别。我们的模型在 11 个基础到新数据集中的 9 个上取得了优于先前方法的准确率,包括 ImageNet、SUN397 和 Caltech101,同时严格保持无需训练的范式。我们的 TLAC 模型取得了 83.44% 的总体准确率,超越了先前最先进的少样本方法 6.75% 的差距。与其他无需训练的方法相比,我们的 TLAC 方法在 13 个数据集上取得了 83.6% 的平均准确率,较先前方法提升了 9.7%。我们的代码可在 https://github.com/ans92/TLAC 获取。
引用
@article{arxiv.2503.12206,
title = {TLAC: Two-stage LMM Augmented CLIP for Zero-Shot Classification},
author = {Ans Munir and Faisal Z. Qureshi and Muhammad Haris Khan and Mohsen Ali},
journal= {arXiv preprint arXiv:2503.12206},
year = {2025}
}
备注
Added code link in the abstract