中文

Percept-V 挑战:多模态LLM能否破解简单感知问题?

计算与语言 2026-01-23 v3 计算机视觉与模式识别

摘要

认知科学研究将视觉感知——即理解和解读视觉输入的能力——视为智力发展的早期标志之一。其TVPS-4框架将人类感知分为七个技能,如视觉判别等。多模态大型语言模型(MLLM)在基本感知方面能否与人类相媲美?尽管已有许多基准评估MLLM在高级推理与知识技能方面的表现,但针对简单感知的研究仍有限。为此,我们引入Percept-V数据集,包含6000个程序生成的无噪图像,分为30个领域,其中每个领域测试一个或多个TVPS-4技能。我们专注于感知,因此使我们的领域相当简单,且解决这些领域所需的推理与知识有限。鉴于现代MLLM能够解决更复杂的任务,我们先验期望是它们会轻易解决这些领域。与我们的信念相反,我们的实验显示,SOTA专有与开源MLLM在Percept-V上的表现均表现薄弱,而人类表现极高。我们发现,随着图像中物体数量的增加,性能迅速下降。我们的实验还识别出所有模型都相当难以应对的感知技能。

关键词

引用

@article{arxiv.2508.21143,
  title  = {The Percept-V Challenge: Can Multimodal LLMs Crack Simple Perception Problems?},
  author = {Samrajnee Ghosh and Naman Agarwal and Hemanshu Garg and Chinmay Mittal and Mausam and Parag Singla},
  journal= {arXiv preprint arXiv:2508.21143},
  year   = {2026}
}