中文

NewtonBench:面向 LLM 智能体的通用科学规律发现基准测试

人工智能 2026-02-25 v3

摘要

大型语言模型正在成为科学规律发现的强大工具,这是人工智能驱动科学中的一项基础性挑战。然而,现有针对此任务的基准测试存在根本性方法三难困局,迫使在科学相关性、可扩展性和抗记忆性之间进行权衡。此外,它们简化了发现过程,仅视为静态函数拟合,未能捕捉通过交互式探索复杂模型系统来揭示内嵌规律的真实科学过程。为缓解这些关键缺口,我们引入NewtonBench,包含12个物理学领域的324个科学规律发现任务。我们的设计通过使用反事实规律位移——对规范规律进行系统性修改——生成大量问题,既可扩展、又具科学相关性且抗记忆。此外,我们将评估从静态函数拟合提升为交互式模型发现,要求智能体通过实验探索模拟的复杂系统以揭示隐藏原理。我们的大量实验揭示了前沿 LLM 中发现能力的明确但脆弱特性:随着系统复杂度增加,这种能力会急剧下降,对观测噪声极其敏感。值得注意的是,我们发现一种悖论性效应:提供代码解释器工具会阻碍更强大的模型,使其过早转向从探索转向开发,导致其对次优解满足于不理想的解决方案。这些结果表明,在复杂、交互式环境中实现稳健、可泛化的发现仍是核心挑战。通过提供一个可扩展、稳健且具有科学真实性的测试平台,NewtonBench 为衡量真实进展并指导下一代具备真正科学发现能力的 AI 智能体开发提供了关键工具。

关键词

引用

@article{arxiv.2510.07172,
  title  = {NewtonBench: Benchmarking Generalizable Scientific Law Discovery in LLM Agents},
  author = {Tianshi Zheng and Kelvin Kiu-Wai Tam and Newt Hue-Nam K. Nguyen and Baixuan Xu and Zhaowei Wang and Jiayang Cheng and Hong Ting Tsang and Weiqi Wang and Jiaxin Bai and Tianqing Fang and Yangqiu Song and Ginny Y. Wong and Simon See},
  journal= {arXiv preprint arXiv:2510.07172},
  year   = {2026}
}

备注

ICLR 2026