Groks、DeepSeek Janus、Gemini、Qwen、Mistral 和 ChatGPT 的视觉推理评估
计算机视觉与模式识别
2025-02-25 v1 人工智能
摘要
传统的多模态大语言模型(LLM)评估受限于其仅关注单张图像推理,未能评估关键方面,如情境理解、推理稳定性和不确定性校准。本研究通过引入集成多图像推理任务、基于拒绝的评估和位置偏差检测的新基准,来克服这些局限性。为评估这些维度,我们进一步引入熵作为衡量跨重排序答案变体推理一致性的新指标。我们将该基准应用于评估 Grok 3、ChatGPT-4o、ChatGPT-o1、Gemini 2.0 Flash Experimental、DeepSeek Janus 模型、Qwen2.5-VL-72B-Instruct、QVQ-72B-Preview 和 Pixtral 12B,涵盖八个视觉推理任务,包括差异识别和图表解释。我们的发现表明,ChatGPT-o1 在整体准确率(82.5%)和拒绝准确率(70.0%)方面领先,紧随其后的是 Gemini 2.0 Flash Experimental(70.8%)。QVQ-72B-Preview 在拒绝准确率方面表现突出(85.5%)。值得注意的是,Pixtral 12B(51.7%) 在特定领域展现了潜力,而 Janus 模型在偏差和不确定性校准方面存在挑战,表现为低拒绝准确率和高熵值。Janus 模型的高熵值(Janus 7B: 0.8392, Janus 1B: 0.787)凸显了其对位置偏差和不稳定推理的易受影响性,与 ChatGPT 模型的低熵值和稳健推理形成鲜明对比。本研究进一步表明,模型规模并非唯一的性能决定因素,Grok 3 尽管参数丰富却未能达到预期水平。通过运用多图像情境、拒绝机制和基于熵的一致性指标,本基准制定了评估下一代多模态 LLM 的新标准,使对人工智能系统进行更稳健可靠的评估成为可能。
引用
@article{arxiv.2502.16428,
title = {Visual Reasoning Evaluation of Grok, Deepseek Janus, Gemini, Qwen, Mistral, and ChatGPT},
author = {Nidhal Jegham and Marwan Abdelatti and Abdeltawab Hendawi},
journal= {arXiv preprint arXiv:2502.16428},
year = {2025}
}