InPhyRe 发现:大型多模态模型在归纳物理推理中存在困难
人工智能
2026-03-19 v2 机器学习
摘要
大型多模态模型将训练期间观察到的物理定律(如动量守恒)编码为参数化知识。这使得 LMM 能够回答物理推理问题,例如从视觉输入预测潜在碰撞事件的结果。然而,由于参数化知识仅包含训练期间见过的物理定律,对于遵循训练期间未见过的物理定律的推理场景而言是不充分的。在这种新颖的物理环境中,人类可以根据提供的演示调整其物理推理。如果 LMM 要在安全关键应用中替代人类智能体,这种归纳物理推理能力是不可或缺的。尽管其很重要,但现有的视觉基准并未评估归纳物理推理,而仅考虑了 LMM 中的参数化知识。为此,我们提出了 InPhyRe,这是第一个用于衡量 LMM 中归纳物理推理的视觉问答基准。InPhyRe 评估了 LMM 在算法生成的合成视频中预测碰撞事件结果的能力。通过检查超过 13 个开源和专有 LMM,InPhyRe 告诉我们:(1) LMM 难以将其关于通用物理定律的有限参数化知识应用于推理;(2) 当推理场景背后的物理定律在训练期间未被见过时,LMM 中的归纳物理推理能力较弱;(3) LMM 中的归纳物理推理存在语言偏差,可能忽略视觉输入,这质疑了 LMM 对视觉输入的可信度。
引用
@article{arxiv.2509.12263,
title = {InPhyRe Discovers: Large Multimodal Models Struggle in Inductive Physical Reasoning},
author = {Gautam Sreekumar and Vishnu Naresh Boddeti},
journal= {arXiv preprint arXiv:2509.12263},
year = {2026}
}
备注
50 pages including appendix