非洲鸦还是欧洲鸦?面向细粒度目标分类的大型视觉语言模型基准测试
计算机视觉与模式识别
2024-06-21 v1 计算与语言
摘要
最近的大型视觉语言模型(LVLMs)在诸多图像理解和推理任务上表现出色。然而,细粒度目标分类(例如区分动物种类)这一任务的探索不足,尽管其下游重要性。我们填补了这一评估缺口,通过构建 FOCI(Fine-grained Object Classification)——一个针对细粒度目标分类的困难多选基准测试,来自现有目标分类数据集:(1)多选方式可避免将分类问题形式化为开放式问答任务时产生的模糊答案;(2)通过从 CLIP 模型中挖掘负样本标签,保留分类的难度。FOCI 补充了五个流行分类数据集,包含来自 ImageNet-21k 的四个领域特定子集。我们在 FOCI 上对 12 个公开 LVLMs 进行基准测试,发现它测试的是与既 established 图像理解和推理基准测试互补的技能。关键的是,CLIP 模型在 FOCI 上的表现显著优于 LVLMs。由于 LVLMs 的图像编码器来自这些 CLIP 模型,这表明编码器与 LLM 在细粒度目标区分方面对齐不足,需要(预)训练数据具备更细粒度的标注。我们在 https://github.com/gregor-ge/FOCI-Benchmark 发布代码。
引用
@article{arxiv.2406.14496,
title = {African or European Swallow? Benchmarking Large Vision-Language Models for Fine-Grained Object Classification},
author = {Gregor Geigle and Radu Timofte and Goran Glavaš},
journal= {arXiv preprint arXiv:2406.14496},
year = {2024}
}