中文

PhyX:你的模型具备物理推理的“才智”吗?

人工智能 2025-05-30 v2

摘要

现有基准未能捕捉智能的一个关键方面:物理推理,即结合领域知识、符号推理和对现实世界约束理解的综合能力。为弥补这一差距,我们引入了PhyX:首个旨在评估模型在视觉场景中进行基于物理的推理能力的大规模基准。PhyX包含3000个精心策划的多模态问题,涵盖6种推理类型,横跨25个子领域和6个核心物理领域:热力学、电磁学、力学、近代物理、光学和波与声学。在我们的综合评估中,即使是最先进的模型在物理推理方面也表现挣扎。GPT-4o、Claude3.7-Sonnet和GPT-o4-mini的准确率分别仅为32.5%、42.2%和45.8%,与人类专家相比,性能差距超过29%。我们的分析揭示了当前模型的关键局限性:过度依赖记忆的学科知识、过度依赖数学公式以及表面化的视觉模式匹配,而非真正的物理理解。我们通过细粒度统计、详细案例研究和多种评估范式进行深入分析,以彻底检验物理推理能力。为确保可复现性,我们基于VLMEvalKit等广泛使用的工具包实现了一个兼容的评估协议,支持一键评估。更多细节请访问我们的项目页面:https://phyx-bench.github.io/。

关键词

引用

@article{arxiv.2505.15929,
  title  = {PhyX: Does Your Model Have the "Wits" for Physical Reasoning?},
  author = {Hui Shen and Taiqiang Wu and Qi Han and Yunta Hsieh and Jizhou Wang and Yuyue Zhang and Yuxin Cheng and Zijian Hao and Yuansheng Ni and Xin Wang and Zhongwei Wan and Kai Zhang and Wendong Xu and Jing Xiong and Ping Luo and Wenhu Chen and Chaofan Tao and Zhuoqing Mao and Ngai Wong},
  journal= {arXiv preprint arXiv:2505.15929},
  year   = {2025}
}