中文

GPT-4o 能否很好地理解视觉信息?对多模态基础模型进行标准计算机视觉任务评估

计算机视觉与模式识别 2026-05-04 v3 人工智能 机器学习

摘要

多模态基础模型(MFMs)如 GPT-4o 最近取得了显著进展,但其在问答之外的详细视觉理解尚不明朗。本文我们在标准计算机视觉任务(语义分割、目标检测、图像分类、深度与表面法线预测)上,对流行的 MFMs(GPT-4o、o4-mini、Gemini 1.5 Pro 和 Gemini 2.0 Flash、Claude 3.5 Sonnet、Qwen2-VL、Llama 3.2)进行基准测试,采用既定数据集(如 COCO、ImageNet 等)。执行此分析的主要挑战在于:1) 大多数模型训练时仅输出文本,无法原生表达多样化领域,如分割区域或 3D 几何;2) 许多领先模型为专有软件,仅以 API 形式提供,无法获取权重进行适配。我们通过提示链将视觉任务转化为可通过文本提示完成、兼容 API 的格式,构建标准化的基准测试框架。我们观察到:1) MFMs 在任何任务上都远不如专用 SOTA 模型。2) 它们是体面的通用型模型,这值得注意,因为它们大概是在图像-文本任务上训练的。3) 它们在语义任务上显著优于几何任务。4) GPT-4o 在非推理模型中表现最佳,在 4/6 项任务中夺得第一。5) 推理模型(如 o3)在几何任务中有所提升。6) 提示链技术会影响性能,但更好的模型对提示变体的敏感度较低。7) 对原生图像生成模型(如最新的 GPT-4o)的分析显示,它们存在幻觉对象或输入输出错位等失效模式。

关键词

引用

@article{arxiv.2507.01955,
  title  = {How Well Does GPT-4o Understand Vision? Evaluating Multimodal Foundation Models on Standard Computer Vision Tasks},
  author = {Rahul Ramachandran and Ali Garjani and Roman Bachmann and Andrei Atanov and Oğuzhan Fatih Kar and Amir Zamir},
  journal= {arXiv preprint arXiv:2507.01955},
  year   = {2026}
}

备注

ICLR 2026. Project page at https://fm-vision-evals.epfl.ch/