DeepPHY:在物理推理任务上评估智能体式视觉语言模型
人工智能
2025-08-08 v1
摘要
虽然视觉语言模型 (VLM) 在感知能力和视觉推理方面表现出强劲性能,但在复杂动态环境中注意力细节和精确动作规划方面仍有不足,导致表现不佳。实际任务通常需要复杂的交互、先进的空间推理、长期计划以及持续的策略优化,通常需要理解目标场景的物理规则。然而,在真实场景中评估这些能力往往代价高昂。为弥合这一差距,我们引入DeepPHY——一个新型基准框架,旨在系统评估VLM对基本物理原理的理解与推理能力。DeepPHY 集成了难度各异的物理推理环境,并纳入细粒度评估指标。我们的评估发现,即便是最先进的VLM也难以将描述性物理知识转化为精确、可预测的控制。
引用
@article{arxiv.2508.05405,
title = {DeepPHY: Benchmarking Agentic VLMs on Physical Reasoning},
author = {Xinrun Xu and Pi Bu and Ye Wang and Börje F. Karlsson and Ziming Wang and Tengtao Song and Qi Zhu and Jun Song and Zhiming Ding and Bo Zheng},
journal= {arXiv preprint arXiv:2508.05405},
year = {2025}
}
备注
48 pages