PRBench:物理研究中端到端论文复现基准
计算与语言
2026-03-31 v1 高能物理 - 格点
高能物理 - 唯象学
计算物理
光学
摘要
由大语言模型驱动的 AI 智能体在推理和问题解决方面表现出强大的能力,能够辅助科学研究任务,如公式推导和代码生成。然而,这些智能体能否可靠地从真实科学论文中完成端到端复现仍是一个未知问题。我们引入 PRBench,这是一个包含 30 个专家精选任务的基准,涵盖物理学的 11 个子领域。每个任务都要求智能体理解已发表论文的方法论,从零实现相应算法,并产生与原 publication 一致的定量结果。智能体仅获得任务指令和论文内容,在沙箱化执行环境中运行。所有任务均来自北京大学物理学院来自 20 多个研究小组的领域专家贡献,每个任务都基于真实发表的论文,通过验证的端到端复现结果和详细的评分标准进行验证。使用一个智能体化评估管道,我们在 PRBench 上评估了一组编码智能体,并分析了它们在科学推理和执行等关键维度上的能力。表现最好的智能体是 OpenAI Codex,由 GPT-5.3-Codex 提供动力,平均总体得分达到 34%。所有智能体都表现出 0% 的端到端成功率,在数据准确性和代码正确性方面尤其表现不佳。我们进一步识别出系统性的失败模式,包括公式实现错误、无法调试数值模拟以及 fabricated 输出数据。总体而言,PRBench 为评估向自主科学研究进程提供了严格的基准。
引用
@article{arxiv.2603.27646,
title = {PRBench: End-to-end Paper Reproduction in Physics Research},
author = {Shi Qiu and Junyi Deng and Yiwei Deng and Haoran Dong and Jieyu Fu and Mao Li and Zeyu Li and Zhaolong Zhang and Huiwen Zheng and Leidong Bao and Anqi Lv and Zihan Mo and Yadi Niu and Yiyang Peng and Yu Tian and Yili Wang and Ziyu Wang and Zi-Yu Wang and Jiashen Wei and Liuheng Wu and Aoran Xue and Leyi Yang and Guanglu Yuan and Xiarui Zhan and Jingjun Zhang and Zifan Zheng and Pengfei Liu and Linrui Zhen and Kaiyang Li and Qichang Li and Ziheng Zhou and Guo-En Nian and Yunwei Xiao and Qing-Hong Cao and Linjie Dai and Xu Feng and Peng Gao and Ying Gu and Chang Liu and Jia Liu and Ming-xing Luo and Yan-Qing Ma and Liang-You Peng and Huichao Song and Shufeng Wang and Chenxu Wang and Tao Wang and Yi-Nan Wang and Chengyin Wu and Pengwei Zhao and Hua Xing Zhu},
journal= {arXiv preprint arXiv:2603.27646},
year = {2026}
}
备注
17 pages, 3 figures