PhysicsMind:用于基础视觉语言模型与世界模型中物理推理与预测的模拟与真实力学基准测试
计算机视觉与模式识别
2026-01-23 v1 人工智能
摘要
现代基础多模态大语言模型(MLLMs)和视频世界模型在数学、常识和视觉推理方面取得了显著进展,但它们对底层物理学的掌握仍未得到充分探索。试图衡量这一点的现有基准依赖于合成的视觉问答模板,或侧重于感知视频质量,这与衡量视频遵循物理定律的程度无关。为了解决这种碎片化问题,我们引入了 PhysicsMind,这是一个包含真实和模拟环境的统一基准,用于评估模型在三个经典原理上的定律一致性推理和生成能力:质心、杠杆平衡和牛顿第一定律。PhysicsMind 包含两个主要任务:i) 视觉问答任务,测试模型是否能从图像或短视频中推理并确定物理量和数值;ii) 视频生成任务,评估预测的运动轨迹是否遵循与真实情况相同的质心、力矩和惯性约束。我们在 PhysicsMind 上评估了广泛的近期模型和视频生成模型,发现它们依赖外观启发式方法,同时经常违反基本力学原理。这些差距表明,当前的规模扩展和训练仍不足以实现稳健的物理理解,这凸显了 PhysicsMind 作为面向物理感知多模态模型的聚焦测试平台的作用。我们的数据将在被接收后发布。
引用
@article{arxiv.2601.16007,
title = {PhysicsMind: Sim and Real Mechanics Benchmarking for Physical Reasoning and Prediction in Foundational VLMs and World Models},
author = {Chak-Wing Mak and Guanyu Zhu and Boyi Zhang and Hongji Li and Xiaowei Chi and Kevin Zhang and Yichen Wu and Yangfan He and Chun-Kai Fan and Wentao Lu and Kuangzhi Ge and Xinyu Fang and Hongyang He and Kuan Lu and Tianxiang Xu and Li Zhang and Yongxin Ni and Youhua Li and Shanghang Zhang},
journal= {arXiv preprint arXiv:2601.16007},
year = {2026}
}