中文

重新审视 MLLMs:对图像分类能力的深入分析

计算机视觉与模式识别 2024-12-24 v1

摘要

随着多模态大语言模型 (MLLMs) 的快速发展,已推出多种基准用于评估其能力。虽然大多数评估都集中于复杂任务,如科学理解和视觉推理,但很少关注评估其基本图像分类能力。本文我们通过深入分析 MLLMs 的图像分类能力来弥补这一差距。具体而言,基于既定数据集,我们检验了广泛的情景,从一般分类任务 (例如 ImageNet、ObjectNet) 到更细粒度的类别,如鸟类和食物分类。我们的发现表明,最新的 MLLMs 在几个数据集上可以匹配甚至超过 CLIP 风格的视觉-语言模型,挑战了之前关于 MLLMs 在图像分类方面较差的假设。为理解这一改进的影响因素,我们深入分析了公开 MLLMs 所采用的网络架构、数据选择和训练配方。我们的结果将这一成功归因于语言模型的进步以及训练数据来源的多样性。基于这些观察,我们进一步分析并归因于概念知识传递和目标概念的增强曝露。我们希望我们的发现为未来 MLLMs 及其在图像分类任务中的评估提供有价值的见解。

关键词

引用

@article{arxiv.2412.16418,
  title  = {Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities},
  author = {Huan Liu and Lingyu Xiao and Jiangjiang Liu and Xiaofan Li and Ze Feng and Sen Yang and Jingdong Wang},
  journal= {arXiv preprint arXiv:2412.16418},
  year   = {2024}
}