中文

探究 AI 推理的临界点:前沿物理研究基准

人工智能 2026-05-12 v4 其他凝聚态物理 计算与语言 高能物理 - 理论 量子物理

摘要

尽管具备推理能力的大语言模型(LLM)在高中数学竞赛和编程方面进展迅速,它们能否有效应对前沿物理研究中发现的复杂、开放式挑战?至关重要的是,物理学家希望 LLM 协助完成哪些类型的推理任务?为了解决这些问题,我们提出了 CritPt(Complex Research using Integrated Thinking - Physics Test,发音同“critical point”),这是第一个旨在测试 LLM 处理未发表的、研究级推理任务的基准,广泛涵盖现代物理研究领域,包括凝聚态物理、量子物理、原子分子与光物理、天体物理、高能物理、数学物理、统计物理、核物理、非线性动力学、流体动力学和生物物理。CritPt 包含 71 个复合研究挑战,旨在模拟入门级的全规模研究项目,这些挑战还被分解为 190 个更简单的检查点任务,以提供更细致的洞察。所有问题均由 50 多位活跃的物理研究人员基于他们自己的研究新创建。每个问题均经过人工精心设计,以确保答案难以猜测且可由机器验证,并由一个针对高级物理特定输出格式高度定制的自动评分流水线进行评估。我们发现,尽管当前最先进的 LLM 在孤立的检查点上展现出初步潜力,但它们远未能够可靠地解决完整的研究级挑战:基础模型中的最佳平均准确率仅为 5.7%,由 GPT-5 (high) 取得,在配备编码工具后适度提升至约 10%。通过 CritPt 提供的现实而标准化的评估,我们突出了当前模型能力与现实物理研究需求之间的巨大脱节,为指导科学化 AI 工具的开发奠定了基础。

关键词

引用

@article{arxiv.2509.26574,
  title  = {Probing the Critical Point (CritPt) of AI Reasoning: a Frontier Physics Research Benchmark},
  author = {Minhui Zhu and Minyang Tian and Xiaocheng Yang and Tianci Zhou and Lifan Yuan and Penghao Zhu and Eli Chertkov and Shengyan Liu and Yufeng Du and Ziming Ji and Indranil Das and Qingzhi Chen and Junyi Cao and Yufeng Du and Jiabin Yu and Peixue Wu and Jinchen He and Yifan Su and Yikun Jiang and Yujie Zhang and Chang Liu and Ze-Min Huang and Weizhen Jia and Yunkai Wang and Farshid Jafarpour and Yong Zhao and Xinan Chen and Jessie Shelton and Aaron W. Young and John Bartolotta and Wenchao Xu and Yue Sun and Anjun Chu and Victor Colussi and Chris Akers and Nathan Brooks and Wenbo Fu and Jinchao Zhao and Marvin Qi and Anqi Mu and Yubo Yang and Allen Zang and Yang Lyu and Peizhi Mai and Christopher Wilson and Xuefei Guo and Juntai Zhou and Daniel Inafuku and Chi Xue and Luyu Gao and Ze Yang and Yaïr Hein and Yonatan Kahn and Kevin Zhou and Di Luo and John Drew Wilson and Jarrod T. Reilly and Dmytro Bandak and Ofir Press and Liang Yang and Xueying Wang and Hao Tong and Nicolas Chia and Eliu Huerta and Hao Peng},
  journal= {arXiv preprint arXiv:2509.26574},
  year   = {2026}
}

备注

40 pages, 6 figures, 6 tables