视觉语言模型无法进行物理变换推理
人工智能
2026-03-10 v1
摘要
理解物理变换是推理动态环境的基本能力。虽然视觉语言模型 (Vision Language Models, VLM) 在具身应用中显示出前景,但是否真正理解物理变换仍不明确。我们引入 ConservationBench 评估保守性——物理量在变换下是否保持不变。该基准覆盖四个属性,包含配对的保守与非保守情景,我们生成了跨 112 个 VLM 的 23,040 个问题。结果揭示了系统性失败:性能接近随机,且在保守任务上取得改进,同时在对照组上表现下降。控制实验显示,强文本先验倾向于不变性,但模型在视觉内容下表现更差。无论是时间分辨率、提示策略,还是精心挑选的抽样方法,都未能帮助模型。这些发现表明,当前的 VLM 在动态场景中未能保持物理属性的变换不变表示。
引用
@article{arxiv.2603.07109,
title = {Vision Language Models Cannot Reason About Physical Transformation},
author = {Dezhi Luo and Yijiang Li and Maijunxian Wang and Tianwei Zhao and Bingyang Wang and Siheng Wang and Pinyuan Feng and Pooyan Rahmanzadehgervi and Ziqiao Ma and Hokin Deng},
journal= {arXiv preprint arXiv:2603.07109},
year = {2026}
}