什么你看见?利用多模态大语言模型提升零样本图像分类
计算机视觉与模式识别
2025-06-27 v5
摘要
大型语言模型(LLM)已被有效应用于许多计算机视觉任务,包括图像分类。本文提出一种简单而有效的方法,用于基于多模态 LLM 进行零样本图像分类。通过多模态 LLM,我们从输入图像生成全面的文本表示。然后,将这些文本表示用于在跨模态嵌入空间中生成固定维度的特征。随后,将这些特征融合以执行零样本分类。我们的方法无需为每个数据集进行提示工程,而是使用单一、简明的提示集合覆盖所有数据集。我们在多个数据集上评估了该方法,结果表明其效果显著,超越了多个数据集上的基准准确率。在十个基准测试中,我们的方法平均实现了 6.2 个百分点的准确率提升,在 ImageNet 数据集上提升了 6.8 个百分点,相对于使用相同 setup 重新评估的先前方法。我们的发现凸显了多模态 LLM 在诸如零样本图像分类等计算机视觉任务中的潜力,显著优于传统方法。
引用
@article{arxiv.2405.15668,
title = {What Do You See? Enhancing Zero-Shot Image Classification with Multimodal Large Language Models},
author = {Abdelrahman Abdelhamed and Mahmoud Afifi and Alec Go},
journal= {arXiv preprint arXiv:2405.15668},
year = {2025}
}