突破界限:探索利用大型多模态模型进行零样本物体分类
计算机视觉与模式识别
2024-01-02 v1 社会与信息网络
摘要
语言模型与视觉模型的协同作用催生了大型语言与视觉助手模型 (LLVAs),旨在让用户参与交织着基于图像查询的丰富对话体验。这些全面的多模态模型无缝集成了视觉编码器与大型语言模型 (LLMs),扩展了其在通用语言和视觉理解中的应用。大型多模态模型 (LMMs) 的出现标志着人工智能 (AI) 助手新时代的到来,拓展了 AI 应用的视野。本文从独特视角审视 LMMs,探索其利用为特定数据集设计的提示执行图像分类任务的有效性。我们还调查了 LLVAs 的零样本学习能力。我们的研究包括在四个多样化数据集上的基准分析:MNIST、Cats Vs. Dogs、Hymnoptera(蚂蚁对蜜蜂),以及一个非常规数据集,包含 Pox 对 Non-Pox 皮肤图像。实验结果表明,该模型在无需任何微调的情况下取得了显著性能,在相应数据集上的分类准确率分别达到 85%、100%、77% 和 79%。为加强我们的分析,我们评估了模型针对特定任务微调后的性能。在一个实例中,微调是在包含患有和未患有自闭症的儿童面部图像的数据集上进行的。微调前,模型的测试准确率为 55%,微调后显著提高至 83%。这些结果与我们之前的发现相结合,强调了 LLVAs 的变革潜力及其在现实场景中的多样化应用。
引用
@article{arxiv.2401.00127,
title = {Pushing Boundaries: Exploring Zero Shot Object Classification with Large Multimodal Models},
author = {Ashhadul Islam and Md. Rafiul Biswas and Wajdi Zaghouani and Samir Brahim Belhaouari and Zubair Shah},
journal= {arXiv preprint arXiv:2401.00127},
year = {2024}
}
备注
5 pages,6 figures, 4 tables, Accepted on The International Symposium on Foundation and Large Language Models (FLLM2023)