为何视觉联合语言模型在图像分类方面表现不佳?
计算机视觉与模式识别
2024-11-05 v2 人工智能
计算与语言
机器学习
摘要
图像分类是机器视觉智能最基本的能力之一。本文使用视觉联合语言模型(VLMs)如 GPT-4V 和 LLaVA 重新审视图像分类任务。我们发现,尽管现有的专有和公开 VLMs 常使用 CLIP 作为视觉编码器且参数数量众多,但在像 ImageNet 这样的标准图像分类基准测试上,性能显著低于 CLIP。为理解原因, 我们探索了关于 VLMs 推理算法、训练目标和数据处理的多个假设。我们的分析表明,主要原因是数据相关的:对于图像分类的关键信息编码在 VLM 的潜在空间中,但只有获得足够的训练数据才能有效解码。具体而言,VLM 在训练中频繁暴露给特定类别的频率与其在这些类别中的性能呈强相关性;当训练数据充足时,VLMs 能够匹配最先进的分类模型的准确率。基于这些发现,我们通过整合分类专注数据集来增强一个 VLM,并在新收集的 ImageWikiQA 数据集上演示了该 VLM分类性能的提升,整体能力也随之提升,提升幅度为 11.8%。
引用
@article{arxiv.2405.18415,
title = {Why are Visually-Grounded Language Models Bad at Image Classification?},
author = {Yuhui Zhang and Alyssa Unell and Xiaohan Wang and Dhruba Ghosh and Yuchang Su and Ludwig Schmidt and Serena Yeung-Levy},
journal= {arXiv preprint arXiv:2405.18415},
year = {2024}
}
备注
Published at NeurIPS 2024