大型多模态模型作为通用情境分类器
计算机视觉与模式识别
2026-02-27 v1
摘要
我们应当使用哪种多模态模型进行分类?以往研究表明,答案在于类CLIP的对比式视觉语言模型(VLM),因其在零样本分类中展现卓越性能。相比之下,大型多模态模型(LMM)更适用于复杂任务。本文认为,这一结论忽略了 LMM 的一个重要能力:情境学习。我们对比式测试了最先进的 LMM 在多样化数据集上的闭合世界分类表现,发现虽其零样本性能低于 CLIP,但仅凭少量情境示例即可匹配甚至超越采用缓存式适配器的对比 VLM(其“情境”等价物)。我们进一步将分析扩展至开放世界场景,由于 LMM 的生成性质,其更适用于该任务。在这一具挑战性的情境下,LMM 在提供不完美情境信息时会遭遇困难。为此,我们提出了 CIRCLE—a 一个简单且无需训练的方法,为情境示例分配伪标签,并利用可用情境自身不断细化。通过大量实验,我们展示 CIRCLE 为开放世界分类建立了稳健的基线,超越了 VLM 对手,凸显了 LMM 作为统一分类器及灵活替代方案的潜力。
引用
@article{arxiv.2602.23229,
title = {Large Multimodal Models as General In-Context Classifiers},
author = {Marco Garosi and Matteo Farina and Alessandro Conti and Massimiliano Mancini and Elisa Ricci},
journal= {arXiv preprint arXiv:2602.23229},
year = {2026}
}
备注
CVPR Findings 2026. Project website at https://circle-lmm.github.io/