人类认知基准揭示多模态大语言模型中的基础性视觉缺陷
计算机视觉与模式识别
2026-05-05 v4 计算与语言
摘要
人类通过从基本原语和 Gestalt 原理到高层语义的自下而上层级来发展感知。相比之下,当前的多模态大语言模型(MLLMs)通常直接在复杂的下游任务上进行训练,常常绕过这些基础视觉能力。为系统性地调查这一差距,我们引入了 VisFactor—a 一个将 FRCT(认知心理学评估工具)中20个视觉相关子测试数字化的基准测试。此外,我们设计了算法以自动构建和验证可控制难度的测试用例。使用 VisFactor,我们评估了39个前沿 MLLM,包括专有模型(如 GPT、Gemini)和开源模型(如 LLaMA、Qwen)。最佳模型仅 achieved 54.0%的得分。分析结果显示良好的内部一致性(Cronbach's alpha = 0.94)和构建效度(与现有视觉基准测试进行比较)。模型在心理旋转、空间关系推理和图底分离等任务上表现不佳,无论模型规模或提示策略如何。这些发现表明,现有通用基准测试上的性能提升可能并不代表对人类类似视觉认知的真正掌握。
引用
@article{arxiv.2502.16435,
title = {Human Cognitive Benchmarks Reveal Foundational Visual Gaps in MLLMs},
author = {Jen-Tse Huang and Dasen Dai and Jen-Yuan Huang and Youliang Yuan and Xiaoyuan Liu and Wenxuan Wang and Wenxiang Jiao and Pinjia He and Zhaopeng Tu and Haodong Duan},
journal= {arXiv preprint arXiv:2502.16435},
year = {2026}
}
备注
Update: Evaluated 39 SOTA MLLMs