超越静态视觉:场景动态场解锁多模态大语言模型中的直观物理理解
计算机视觉与模式识别
2026-04-07 v1 人工智能
摘要
尽管多模态大语言模型(MLLMs)在图像和视频理解方面展现出令人印象深刻的能力,但它们理解物理世界的能力已成为一个日益重要的研究焦点。尽管有所改进,当前的MLLMs在高级物理推理方面仍面临巨大困难。在这项工作中,我们研究了物理推理的第一步,即直观物理理解,揭示了它们在理解连续物体动力学方面的重大局限性。为了隔离并评估这一特定能力,我们引入了两个基础基准任务:下一帧选择(NFS)和时间一致性验证(TCV)。我们的实验表明,即使是最先进的MLLMs在这些基础任务上也表现不佳。为了解决这一局限性,我们提出了场景动态场(SDF),这是一种简洁的方法,它在多任务微调框架内利用物理模拟器。SDF显著提升了性能,在流体任务上实现了高达20.7%的增益,同时对未见过的物理领域展现出强大的泛化能力。这项工作不仅突显了当前MLLMs中的一个关键差距,也为开发更具物理基础的多模态大语言模型提供了一种有前景且成本效益高的方法。我们的代码和数据可在https://github.com/andylinx/Scene-Dynamic-Field获取。
引用
@article{arxiv.2604.03302,
title = {Beyond Static Vision: Scene Dynamic Field Unlocks Intuitive Physics Understanding in Multi-modal Large Language Models},
author = {Nanxi Li and Xiang Wang and Yuanjie Chen and Haode Zhang and Hong Li and Yong-Lu Li},
journal= {arXiv preprint arXiv:2604.03302},
year = {2026}
}