中文

大型多模态模型作为开放世界图像分类器

计算机视觉与模式识别 2025-10-17 v2

摘要

传统图像分类需要预定义的语义类别列表。相比之下,大型多模态模型(LMM)可通过自然语言直接对图像进行分类(例如,回答“图像中的主要对象是什么?”)。尽管具备这种卓越能力,但现有研究在LMM分类性能方面仍受限于范围,常常假设在具有预定义类别集合的封闭世界设置下进行。本文弥补了这一差距,通过在真正的开放世界环境中彻底评估LMM的分类性能。我们首先对该任务进行形式化,引入评估协议,定义各种指标以衡量预测类别与真实类别之间的对齐程度。随后,我们在10个基准数据集上评估了13个模型,涵盖原型类、非原型类、细粒度类和非常细粒度类,展示了LMM在该任务中所面临的挑战。基于所提出指标的进一步分析揭示了LMM所犯的错误类型,突出了粒度和细粒度能力方面的挑战,表明有针对性的提示和推理可缓解这些问题。

关键词

引用

@article{arxiv.2503.21851,
  title  = {On Large Multimodal Models as Open-World Image Classifiers},
  author = {Alessandro Conti and Massimiliano Mancini and Enrico Fini and Yiming Wang and Paolo Rota and Elisa Ricci},
  journal= {arXiv preprint arXiv:2503.21851},
  year   = {2025}
}

备注

Accepted at ICCV2025, 23 pages, 13 figures, code is available at https://github.com/altndrr/lmms-owc