十年视觉语言AI模型在准确性和视觉认知错误上的演变
计算机视觉与模式识别
2026-07-10 v1 人工智能
摘要
视觉语言模型(VLM)在过去十年中在视觉推理方面取得了显著进展。大多数评估使用简单的场景(MS-COCO),这些场景并未展示复杂的人类交互或行为,只有少数非策划的人类描述作为基准,并且没有专注于理解模型的错误类型。在这里,我们引入了复杂社会行为(CSB)数据集,包含100张描绘复杂社会交互/行为的图像。我们分析了十年间(2017-2025)VLM(四个预多模态大语言模型,MLLM,和五个MLLM)场景描述的进展。我们评估了模型和20个人类描述相对于CSB数据集和MS-COCO样本上的金标准的准确性。我们分析了五种视觉认知错误类型:目标检测、识别、幻觉、场景理解和空间依赖性。CSB数据集在场景描述准确性上显示出比MS-COCO更显著的改进,预MLLM的准确性远低于排名最低的人类描述,而MLLM达到了与排名最高的人类描述相似的准确性。我们表明,MLLM已经消除了简单MS-COCO场景和描绘复杂行为(CSB)场景之间在场景描述准确性上的差距。MLLM几乎消除了我们测试数据集中的所有错误类型,除了偶尔依赖与人类不同的图像区域进行场景描述(空间依赖性错误)。我们还表明,检测、识别和幻觉错误对场景描述准确性的影响最大。总之,我们的发现为视觉语言模型在过去十年中如何进步提供了更全面的评估。
引用
@article{arxiv.2607.09654,
title = {Evolution of Accuracy and Visual-Cognitive Errors in a Decade of Vision-Language AI Models},
author = {Shravan Murlidaran and Miguel P. Eckstein},
journal= {arXiv preprint arXiv:2607.09654},
year = {2026}
}