LABBench2:用于评估执行生物学研究能力的 AI 系统的改进基准
人工智能
2026-05-07 v2 计算与语言
机器学习
摘要
针对 AI 加速科学发现的乐观主义持续增长。当前 AI 在科学研究中的应用范围涵盖在科学数据上训练专用基础模型到智能体式自主假设生成系统,再到 AI 驱动的自主实验室。因此,衡量 AI 系统在科学领域进展的需求不仅要加速,而且越来越要聚焦于更真实的能力。除了记忆类知识甚至仅仅是推理,实际衡量执行有意义工作的能力。先前的工作引入了语言智能体生物基准(LAB-Bench),作为衡量这些能力的初步尝试。本文提出了该基准的演进版本 LABBench2,用于衡量 AI 系统执行有用科学任务的真实世界能力。LABBench2 包含近 1,900 个任务,主要是延续 LAB-Bench,衡量类似的能力但在更真实的情境中。我们评估了当前前沿模型的性能,并表明尽管 LAB-Bench 和 LABBench2 所衡量的能力有所提升,但 LABBench2 在难度上提供了有意义的提升(模型特定的准确率差异范围为-26%至-46%),并强调仍有性能提升的余地。LABBench2 延续了 LAB-Bench 作为 AI 科学研究能力事实基准的传统,我们希望它继续帮助推动 AI 工具在这些核心研究功能方面的发展。为促进社区使用和开发,我们提供了任务数据集(https://huggingface.co/datasets/futurehouse/labbench2)以及公共评估工具(https://github.com/EdisonScientific/labbench2)。
引用
@article{arxiv.2604.09554,
title = {LABBench2: An Improved Benchmark for AI Systems Performing Biology Research},
author = {Jon M Laurent and Albert Bou and Michael Pieler and Conor Igoe and Alex Andonian and Siddharth Narayanan and James Braza and Alexandros Sanchez Vassopoulos and Jacob L Steenwyk and Blake Lash and Andrew D White and Samuel G Rodriques},
journal= {arXiv preprint arXiv:2604.09554},
year = {2026}
}