中文

PRL-Bench:评估大语言模型在前沿物理研究中能力的综合基准

机器学习 2026-04-20 v1 人工智能 数据分析、统计与概率

摘要

智能体科学(agentic science)的范式要求 AI 系统进行稳健的推理并参与长周期、自主的探索。然而,当前的科学基准仍局限于领域知识理解和复杂推理,未能评估真实世界研究的探索性质和过程复杂性。在这项工作中,我们提出了理论和计算物理学中面向研究的评估,这是一个天然的测试平台,具有全面的领域知识、复杂的推理以及可验证的端到端工作流程,且不依赖于实验。我们在此介绍 PRL-Bench(Physics Research by LLMs),这是一个旨在系统描绘大语言模型(LLM)执行端到端物理研究能力边界的基准。PRL-Bench 从 2025 年 8 月以来的最新《物理评论快报》(Physical Review Letters)中精选了 100 篇论文,并由领域专家验证,涵盖了现代物理学中五个理论和计算密集的子领域:天体物理学、凝聚态物理学、高能物理学、量子信息学和统计物理学。基准中的每个任务都旨在复现真实科学研究的核心属性,包括面向探索的公式化、长周期工作流和客观可验证性,从而重构真实物理研究的基本推理过程和研究工作流。对前沿模型的评估表明,性能仍然有限,最佳总分低于 50,揭示了当前 LLM 能力与真实科学研究需求之间的显著差距。PRL-Bench 作为一个可靠的测试平台,用于评估下一代 AI 科学家,推动 AI 系统迈向自主科学发现。

关键词

引用

@article{arxiv.2604.15411,
  title  = {PRL-Bench: A Comprehensive Benchmark Evaluating LLMs' Capabilities in Frontier Physics Research},
  author = {Tingjia Miao and Wenkai Jin and Muhua Zhang and Jinxin Tan and Yuelin Hu and Tu Guo and Jiejun Zhang and Yuhan Wang and Wenbo Li and Yinuo Gao and Shuo Chen and Weiqi Jiang and Yayun Hu and Zixing Lei and Xianghe Pang and Zexi Liu and Yuzhi Zhang and Linfeng Zhang and Kun Chen and Wei Wang and Weinan E and Siheng Chen},
  journal= {arXiv preprint arXiv:2604.15411},
  year   = {2026}
}

备注

15 pages, 5 figures