基于积木块探析大型多模态模型的分类能力
计算机视觉与模式识别
2024-09-04 v1 人工智能
摘要
分类是人类核心认知能力,涉及基于共同特征对物体进行组织的能力,这在认知科学和计算机视觉中都至关重要。为评估视觉 AI 模型的分类能力,已提出 various 代理任务,从数据集到开放世界情景进行识别。近期大型多模态模型 (LMM) 在高层次视觉任务(如视觉问答、视频时间推理等)方面取得了令人瞩目的成绩,这得益于先进的架构和大规模多模态指令微调。虽然已有研究开发了整体性基准来衡量 LMM 的高层次视觉能力,但仍缺乏对最基础分类能力的纯粹且深入的定量评估。根据人类认知过程的研究,分类可被视为包含两个部分:类别学习和类别使用。为此,我们提出一种基于复合积木块的新型、具挑战性且高效的基准,称为 ComBo,提供一种解耦的评估框架,涵盖从学习到使用的整个分类过程。通过分析多个评估任务的结果,我们发现尽管 LMM 在学习新类别方面表现出可接受的泛化能力,但在许多方面仍与人类存在差距,例如对空间关系的精细感知和抽象类别理解。通过研究分类,我们为 LMM 在可解释性和泛化性方面的进一步发展提供了灵感。
引用
@article{arxiv.2409.01560,
title = {Blocks as Probes: Dissecting Categorization Ability of Large Multimodal Models},
author = {Bin Fu and Qiyang Wan and Jialin Li and Ruiping Wang and Xilin Chen},
journal= {arXiv preprint arXiv:2409.01560},
year = {2024}
}
备注
39 pages, 28 figures, 4 tables. Accepted at The 35th British Machine Vision Conference (BMVC 2024). Project page at https://fubin29.github.io/Blocks-as-Probes/