中文

BabyVision:超越语言的视觉推理

计算机视觉与模式识别 2026-01-13 v1 计算与语言

摘要

尽管人类在习得语言之前很久就发展了核心视觉技能,但当代多模态大语言模型(MLLM)仍然严重依赖语言先验来弥补其脆弱的视觉理解。我们发现了一个关键事实:最先进的MLLM在人类(甚至3岁儿童)都能轻松解决的基本视觉任务上持续失败。为了系统地研究这一差距,我们引入了BabyVision,一个旨在评估MLLM独立于语言知识的核心视觉能力的基准。BabyVision涵盖了广泛的任务,包含388个项目,分为四个关键类别下的22个子类。实证结果和人工评估表明,领先的MLLM的表现显著低于人类基线。Gemini3-Pro-Preview得分为49.7,落后于6岁人类,远低于成年人平均得分94.1。这些结果表明,尽管在知识密集型评估中表现出色,但当前的MLLM仍然缺乏基本的视觉基元。BabyVision的进展代表了迈向人类水平视觉感知和推理能力的一步。我们还通过提出BabyVision-Gen和自动评估工具包,探索了使用生成模型解决视觉推理问题。我们的代码和基准数据已在https://github.com/UniPat-AI/BabyVision发布,以供复现。

关键词

引用

@article{arxiv.2601.06521,
  title  = {BabyVision: Visual Reasoning Beyond Language},
  author = {Liang Chen and Weichu Xie and Yiyan Liang and Hongfeng He and Hans Zhao and Zhibo Yang and Zhiqi Huang and Haoning Wu and Haoyu Lu and Y. charles and Yiping Bao and Yuantao Fan and Guopeng Li and Haiyang Shen and Xuanzhong Chen and Wendong Xu and Shuzheng Si and Zefan Cai and Wenhao Chai and Ziqi Huang and Fangfu Liu and Tianyu Liu and Baobao Chang and Xiaobo Hu and Kaiyuan Chen and Yixin Ren and Yang Liu and Yuan Gong and Kuan Li},
  journal= {arXiv preprint arXiv:2601.06521},
  year   = {2026}
}

备注

26 pages, Homepage at https://unipat.ai/blog/BabyVision