中文

像素、模式,但无诗意:像人类一样看世界

计算机视觉与模式识别 2025-07-24 v1 人工智能 计算与语言

摘要

在多模态大语言模型(MLLMs)中实现类人感知与推理是人工智能的核心挑战。尽管近期研究主要聚焦于增强 MLLMs 的推理能力,但一个基本问题依然存在:多模态大语言模型能否真正像人类一样感知世界?本文将焦点从推理转向感知。我们并未专门构建针对推理的基准测试,而是引入了图灵眼力测试(TET),这是一个面向感知的挑战性基准,包含四项诊断任务,用于评估 MLLMs 在人类凭直觉处理的合成图像上的表现。我们的研究发现,最先进的 MLLMs 在这些对人类而言轻而易举的感知任务上表现出灾难性失败。在语言骨干网络上有效的上下文学习和训练均未能改善在我们任务上的表现,而对视觉塔进行微调则能实现快速适应,这表明我们的基准对视觉塔的泛化能力提出了挑战,而非对语言骨干网络的知识与推理能力提出挑战——这是当前 MLLMs 与人类感知之间的关键差距。我们在本版本中发布了 TET 任务的一个代表性子集,并将在未来的工作中引入更多样化的任务和增强视觉泛化的方法。

关键词

引用

@article{arxiv.2507.16863,
  title  = {Pixels, Patterns, but No Poetry: To See The World like Humans},
  author = {Hongcheng Gao and Zihao Huang and Lin Xu and Jingyi Tang and Xinhao Li and Yue Liu and Haoyang Li and Taihang Hu and Minhua Lin and Xinlong Yang and Ge Wu and Balong Bi and Hongyu Chen and Wentao Zhang},
  journal= {arXiv preprint arXiv:2507.16863},
  year   = {2025}
}