QuantiPhy:量化基准评估视觉语言模型的物理推理能力
人工智能
2025-12-23 v1
摘要
理解物理世界是通用人工智能代理的基本要求。然而,目前尚不清楚,领先的视觉感知模型(如大型视觉语言模型)是否能够对物理属性进行定量推理。现有评估主要基于VQA且为定性质询,难以洞察这些模型能否从视频观察中推断出运动物体的运动学量。为此,我们提出了QuantiPhy——第一个专门衡量视觉语言模型物理推理能力的基准测试。该基准包含超过3300个带数值真实值的视频文本实例,评估模型在给定时间戳下估计物体大小、速度和加速度的性能,并以其中一种属性作为输入先验。基准对提示词和评分标准化处理,以衡量数值精度,实现模型间的公平比较。我们在领先的视觉语言模型上实验发现,其定性合理性与实际数值正确性之间存在持续的差距。我们进一步深入分析了诸多关键因素(如背景噪声、反事实先验、策略性提示),发现领先的视觉语言模型在对运动学属性进行定量推理时,过度依赖预训练的世界知识,而非忠实地使用提供的视觉和文本输入作为参考。QuantiPhy提供了第一个严谨、可扩展的测试平台,使视觉语言模型得以超越纯粹的语言合理性,迈向基于数值的物理理解。
引用
@article{arxiv.2512.19526,
title = {QuantiPhy: A Quantitative Benchmark Evaluating Physical Reasoning Abilities of Vision-Language Models},
author = {Li Puyin and Tiange Xiang and Ella Mao and Shirley Wei and Xinye Chen and Adnan Masood and Li Fei-fei and Ehsan Adeli},
journal= {arXiv preprint arXiv:2512.19526},
year = {2025}
}