中文

DeepPHY:在物理推理任务上评估智能体式视觉语言模型

人工智能 2025-08-08 v1

摘要

虽然视觉语言模型 (VLM) 在感知能力和视觉推理方面表现出强劲性能,但在复杂动态环境中注意力细节和精确动作规划方面仍有不足,导致表现不佳。实际任务通常需要复杂的交互、先进的空间推理、长期计划以及持续的策略优化,通常需要理解目标场景的物理规则。然而,在真实场景中评估这些能力往往代价高昂。为弥合这一差距,我们引入DeepPHY——一个新型基准框架,旨在系统评估VLM对基本物理原理的理解与推理能力。DeepPHY 集成了难度各异的物理推理环境,并纳入细粒度评估指标。我们的评估发现,即便是最先进的VLM也难以将描述性物理知识转化为精确、可预测的控制。

关键词

引用

@article{arxiv.2508.05405,
  title  = {DeepPHY: Benchmarking Agentic VLMs on Physical Reasoning},
  author = {Xinrun Xu and Pi Bu and Ye Wang and Börje F. Karlsson and Ziming Wang and Tengtao Song and Qi Zhu and Jun Song and Zhiming Ding and Bo Zheng},
  journal= {arXiv preprint arXiv:2508.05405},
  year   = {2025}
}

备注

48 pages