像素到原理:探测多模态语言模型中直观物理理解
计算与语言
2025-07-23 v1
摘要
本文系统评估了最新的多模态大语言模型(MLLMs)在直观物理任务上的表现,采用 GRASP 和 IntPhys 2 数据集。我们评估了开源模型 InternVL 2.5、Qwen 2.5 VL、LLaVA-OneVision 以及专有模型 Gemini 2.0 Flash Thinking,发现即使是最新模型也难以可靠区分物理上合理与不合理的情景。为超越性能指标,我们对模型嵌入进行探针分析,提取关键处理阶段的中间表示,检查任务相关信息是否得到保留。我们的结果显示,根据任务难度,可能出现关键的视觉-语言错位:视觉编码器成功捕捉物理合理性线索,但该信息未被有效利用于语言模型,导致推理失败。这种错位表明,MLLMs 在直观物理任务中的主要限制并非视觉组件,而是视觉和语言信息整合的无效性。我们的发现将视觉-语言对齐 identified as a key area for improvement,为未来 MLLMs 的开发提供了见解。
引用
@article{arxiv.2507.16572,
title = {Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models},
author = {Mohamad Ballout and Serwan Jassim and Elia Bruni},
journal= {arXiv preprint arXiv:2507.16572},
year = {2025}
}