超越 VQA:为 MLLM 评估提供检测、描述、判别
计算机视觉与模式识别
2024-09-24 v1
摘要
多选题的视觉问题解答 (VQA) 使多模态大语言模型 (MLLM) 的视觉中心评估成为可能。虽然它可靠地检查特定视觉能力的存在,但模型从多选中选择答案 (VQA 评估) 较容易于生成答案本身。在本工作中,我们提供了一种新视角:通过评估 MLLM 理解特定视觉概念的能力,方法是其唯一描述两个仅在目标视觉概念上不同的极其相似图像的能力。具体而言,我们评估 MLLM 捕获特定视觉差异点能力,通过自检检索,即使用其生成的标题检索目标图像,而将另一图像作为干扰项。我们作为 D3 框架的一部分策划了 247 对高度相似的图像对。对于每对图像,模型被提示:(1) 检测特定视觉差异,(2)独特地描述目标图像以便 (3) 判别目标图像与干扰项。D3 中的自检检索支持跨六种不同视觉模式的白盒评估,揭示当前模型在独立辨别细粒度视觉差异方面存在挑战,开源模型未能超过随机猜测。
引用
@article{arxiv.2409.15125,
title = {Detect, Describe, Discriminate: Moving Beyond VQA for MLLM Evaluation},
author = {Manu Gaur and Darshan Singh S and Makarand Tapaswi},
journal= {arXiv preprint arXiv:2409.15125},
year = {2024}
}
备注
ECCV 2024 Workshop EVAL-FoMo; Project Page: https://katha-ai.github.io/projects/detect-describe-discriminate/