AIRS-Bench:面向前沿 AI 研究科学代理的任务套件
人工智能
2026-02-17 v3
摘要
大型语言模型代理在推动科学研究方面具有巨大潜力。为加速这一进程,我们引入 AIRS-Bench(AI Research Science Benchmark),一个来自最先进机器学习论文的 20 个任务套件。这些任务跨越多个领域,包括语言建模、数学、生物信息学和时间序列预测。AIRS-Bench 任务评估代理在整个研究生命周期中的 agentic 能力——包括想法生成、实验分析和迭代细化——而无需提供基线代码。AIRS-Bench 任务格式灵活,可轻松集成新任务并对不同 agentic 框架进行严格比较。我们使用前沿模型配合顺序和并行 scaffold 建立基线。我们的结果表明,代理在四个任务中超越了人类 SOTA,但在另外十六个任务中未能匹配人类水平。即便当代理超越人类基准时,也未达到底层任务的理论性能上限。这表明 AIRS-Bench 仍远未饱和,为进一步改进提供了广阔空间。我们开源了 AIRS-Bench 任务定义和评估代码,以催化自主科学研究的进一步发展。
关键词
引用
@article{arxiv.2602.06855,
title = {AIRS-Bench: a Suite of Tasks for Frontier AI Research Science Agents},
author = {Alisia Lupidi and Bhavul Gauri and Thomas Simon Foster and Bassel Al Omari and Despoina Magka and Alberto Pepe and Alexis Audran-Reiss and Muna Aghamelu and Nicolas Baldwin and Lucia Cipolina-Kun and Jean-Christophe Gagnon-Audet and Chee Hau Leow and Sandra Lefdal and Hossam Mossalam and Abhinav Moudgil and Saba Nazir and Emanuel Tewolde and Isabel Urrego and Jordi Armengol Estape and Amar Budhiraja and Gaurav Chaurasia and Abhishek Charnalia and Derek Dunfield and Karen Hambardzumyan and Daniel Izcovich and Martin Josifoski and Ishita Mediratta and Kelvin Niu and Parth Pathak and Michael Shvartsman and Edan Toledo and Anton Protopopov and Roberta Raileanu and Alexander Miller and Tatiana Shavrina and Jakob Foerster and Yoram Bachrach},
journal= {arXiv preprint arXiv:2602.06855},
year = {2026}
}
备注
49 pages, 14 figures, 10 tables