中文

AIRA_2:克服 AI 研究代理的瓶颈

人工智能 2026-04-14 v2

摘要

现有的研究识别了 AI 研究代理中的三个结构性性能瓶颈:(1)同步单 GPU 执行限制了样本吞吐量,限制了搜索的效益;(2)泛化差距,其中基于验证的选择导致过拟合,随着搜索视角的延伸导致性能下降;(3)固定单轮 LLM 算子的能力受限,施加了搜索性能的上限。我们引入的 AIRA2_2 通过三种架构选择来解决这些瓶颈:一个异步多 GPU 工作池按线性比例增加实验吞吐量;一个隐藏一致评估协议提供可靠的评估信号;以及具有动态范围界限和交互式调试能力的 ReAct 代理。在 MLE-bench-30 上,AIRA2^{\dagger}_{2} 在 24 小时时实现了81.5%的平均百分位排名,在72小时时实现了83.1%的百分位排名,超越了最强的基线(实现72.7%)。在 AIRS-Bench 上,AIRA2_2 在6个多样化的研究任务中超过了人类最先进水平。消融实验确认每个架构组件都是必要的,性能遵循可预测的比例规律,这种规律可跨 LLM 主干 transferring,并且先前工作报告的“过拟合”是由评估噪声而非真实数据记忆驱动的。

关键词

引用

@article{arxiv.2603.26499,
  title  = {AIRA_2: Overcoming Bottlenecks in AI Research Agents},
  author = {Karen Hambardzumyan and Nicolas Baldwin and Edan Toledo and Rishi Hazra and Michael Kuchnik and Bassel Al Omari and Thomas Simon Foster and Anton Protopopov and Jean-Christophe Gagnon-Audet and Ishita Mediratta and Kelvin Niu and Michael Shvartsman and Alisia Lupidi and Alexis Audran-Reiss and Parth Pathak and Tatiana Shavrina and Despoina Magka and Hela Momand and Derek Dunfield and Nicola Cancedda and Pontus Stenetorp and Carole-Jean Wu and Jakob Nicolaus Foerster and Yoram Bachrach and Martin Josifoski},
  journal= {arXiv preprint arXiv:2603.26499},
  year   = {2026}
}