多模态大模型是否被困在视觉之室中?
计算机视觉与模式识别
2025-06-02 v2
摘要
能够“看见”图像的多模态大模型(MLMs)能否被称作“理解”了它?受 Searle 的中文屋启发,我们提出“视觉之室”论证:一个系统可能通过遵循算法规则处理并描述视觉输入的每个细节,却并未真正理解其潜在意图。这一困境挑战了感知精通即意味着真正理解的普遍假设。在实现层面,我们引入了一个涵盖感知与认知的双层评估框架。感知组件评估 MLMs 能否准确捕捉视觉内容的表层细节,而认知组件则考察其推断反讽极性的能力。为支持该框架,我们进一步引入了一个高质量的多模态反讽数据集,包含 924 张静态图像与 100 个动态视频。所有反讽标签均由原作者标注并经独立审查者验证,以确保清晰性与一致性。我们评估了八个 SoTA MLMs。我们的结果突出了三个关键发现:(1) MLMs 在视觉感知方面表现出高准确率;(2) 即使感知正确,MLMs 在反讽理解上的平均错误率仍约为 ~17.1\%,揭示了看见与理解之间的显著差距;(3) 这一差距源于上下文整合、情感推理与语用推断方面的不足。本工作为所提出的视觉之室论证提供了经验基础,并为 MLMs 提供了一种新的评估范式。
引用
@article{arxiv.2505.23272,
title = {Are MLMs Trapped in the Visual Room?},
author = {Yazhou Zhang and Chunwang Zou and Qimeng Liu and Lu Rong and Ben Yao and Zheng Lian and Qiuchi Li and Peng Zhang and Jing Qin},
journal= {arXiv preprint arXiv:2505.23272},
year = {2025}
}
备注
19 pages