PhysReason:面向物理推理的综合基准
人工智能
2025-05-27 v2
摘要
大型语言模型在数学和逻辑推理等多个领域展现出惊人的能力,但当前评估忽略了物理推理——这一需要物理定理和约束的复杂任务。我们提出 PhysReason,包含 1200 题问题的基准,其中知识类占 25%,推理类占 75%,后者按易、中、难三个难度级别划分。值得注意的是,问题平均需要 8.1 步解答,困难问题需 15.6 步,反映了物理推理的复杂性。我们提出了物理解答自动评分框架,集成高效的答案级评估与全面的步骤级评估。顶尖模型如 Deepseek-R1、Gemini-2.0-Flash-Thinking 和 o3-mini-high 在答案级评估中得分不足 60%,知识类问题得分下降明显:从知识类问题的 75.11%跌至困难问题的 31.95%。通过步骤级评估,我们识别出四个关键瓶颈:物理定理应用、物理过程理解、计算以及物理条件分析。这些发现将 PhysReason 定位为评估大型语言模型物理推理能力的新型综合基准。我们的代码和数据将发布于 https:/dxzxy12138.github.io/PhysReason。
引用
@article{arxiv.2502.12054,
title = {PhysReason: A Comprehensive Benchmark towards Physics-Based Reasoning},
author = {Xinyu Zhang and Yuxuan Dong and Yanrui Wu and Jiaxing Huang and Chengyou Jia and Basura Fernando and Mike Zheng Shou and Lingling Zhang and Jun Liu},
journal= {arXiv preprint arXiv:2502.12054},
year = {2025}
}