ReplicationBench:AI 代理能否复制天体物理研究论文?
计算与语言
2025-11-25 v2 天体物理仪器与方法
摘要
前沿 AI 代理显示出日益增大的作为科学研究助理的潜力,未来可能对扩展的、开放的研究工作流程大有裨益。然而,要将代理用于新颖的研究,首先必须评估其工作的底层忠诚性和正确性。为评估代理作为研究助理的能力,我们引入 ReplicationBench——一个测试代理能否从天体物理文献中复制整个研究论文的评估框架。天体物理学因研究依赖大量归档数据和计算研究,几乎无需实际实验,特别适合作为 AI 代理科学研究的测试场。我们将每篇论文拆分为若干任务,要求代理复制论文的核心贡献,包括实验设置、推导、数据分析和代码库。每项任务均与原论文作者协作开发,旨在针对关键科学结果进行客观评估,从而评估代理的忠诚性(遵循原方法)和正确性(结果的技术准确性)。ReplicationBench 对当前前沿语言模型而言极具挑战性:即便是最佳表现的语言模型的得分也不到 20%。我们与领域专家合作分析了 ReplicationBench 的轨迹,发现代理在科学研究中存在丰富且多样的失败模式。ReplicationBench 建立了第一个面向论文规模、经专家验证的天体物理研究任务基准,揭示了关于代理性能在数据驱动科学其他领域具有可泛化洞察,并为衡量 AI 代理在科学研究中的可靠性提供了可扩展框架。
引用
@article{arxiv.2510.24591,
title = {ReplicationBench: Can AI Agents Replicate Astrophysics Research Papers?},
author = {Christine Ye and Sihan Yuan and Suchetha Cooray and Steven Dillmann and Ian L. V. Roque and Dalya Baron and Philipp Frank and Sergio Martin-Alvarez and Nolan Koblischke and Frank J Qu and Diyi Yang and Risa Wechsler and Ioana Ciuca},
journal= {arXiv preprint arXiv:2510.24591},
year = {2025}
}