KidVis: 多模态大语言模型是否具备6岁儿童的视觉感知能力?
计算机视觉与模式识别
2026-01-14 v1
摘要
尽管多模态大语言模型(MLLMs)在高层次推理任务(如复杂图表解读)中展现了令人印象深刻的能力,但它们是否具备与人类直觉相当的基本视觉基元仍是一个悬而未决的问题。为探究此问题,我们引入了KidVis,一个基于人类视觉发展理论的新型基准。KidVis将视觉智能解构为六种原子能力——专注力、追踪力、辨别力、记忆力、空间感和完形能力——这些能力是6-7岁儿童已经具备的,包含10类低语义依赖的视觉任务。在人类生理基线上评估20个最先进的MLLMs揭示出显著的性能差距。结果表明,虽然人类儿童的平均得分近乎完美,达到95.32,但最先进的GPT-5仅获得67.33。至关重要的是,我们观察到一个“缩放定律悖论”:简单地增加模型参数并不能在这些基础视觉能力上带来线性提升。本研究证实,当前的MLLMs尽管推理能力强大,但缺乏通用视觉智能所需的基本生理感知基元。
引用
@article{arxiv.2601.08292,
title = {KidVis: Do Multimodal Large Language Models Possess the Visual Perceptual Capabilities of a 6-Year-Old?},
author = {Xianfeng Wang and Kaiwei Zhang and Qi Jia and Zijian Chen and Guangtao Zhai and Xiongkuo Min},
journal= {arXiv preprint arXiv:2601.08292},
year = {2026}
}