中文

FIRE-Bench:评估智能体在科学洞见重新发现方面的能力

人工智能 2026-02-04 v1

摘要

由大型语言模型 (LLM) 提供动力的自主智能体承诺能够 end-to-end 加速科学发现,但对其可验证发现能力的严格评估仍是核心挑战。现有基准面临权衡:要么严重依赖 LLM-as-judge 对自动生成的研究输出进行评估,要么优化便利且孤立的绩效指标,这些指标仅提供科学洞见的粗略代理。为解决这一问题,我们引入 FIRE-Bench(Full-cycle Insight Rediscovery Evaluation),通过重新发现来自最近高影响力机器学习研究中已建立发现来评估智能体。智能体仅获得从已发布、经验证研究中提取的高层次研究问题,必须自主探索想法、设计实验、实现代码、执行计划并得出以经验证据支持的结论。我们在 FIRE-Bench 上评估了一系列最先进的智能体,背bone 使用像 gpt-5 这样的前沿 LLM。我们的结果显示,完整的科学研究对当前智能体系统仍具有挑战性:即使是最强大的智能体也仅实现有限的重新发现成功率(<50 F1),在不同运行之间表现出高方差,并显示出在实验设计、执行和基于证据的推理中反复出现的失败模式。FIRE-Bench 提供了一种严格且可诊断的框架,用于衡量向可靠的智能体驱动科学发现取得进展的能力。

关键词

引用

@article{arxiv.2602.02905,
  title  = {FIRE-Bench: Evaluating Agents on the Rediscovery of Scientific Insights},
  author = {Zhen Wang and Fan Bai and Zhongyan Luo and Jinyan Su and Kaiser Sun and Xinle Yu and Jieyuan Liu and Kun Zhou and Claire Cardie and Mark Dredze and Eric P. Xing and Zhiting Hu},
  journal= {arXiv preprint arXiv:2602.02905},
  year   = {2026}
}

备注

30 pages, 4 figures, 10 tables