中文

InnovatorBench:评估 AI 代理开展创新性大语言模型研究能力

人工智能 2025-11-04 v2

摘要

AI 代理能够通过自动化假设形成、实验设计、编码、执行和分析来加速科学发现,但现有基准测试在简化环境中仅探索狭窄技能。为填补这一空白,我们介绍 InnovatorBench,一个用于真实、端到端评估代理执行大语言模型 (LLM) 研究能力的基准平台对。它包含 20 个任务,涵盖数据构造、过滤、增强、损失设计、奖励设计和骨架构建,需要可运行的产物并评估正确性、性能、输出质量和不确定性。为支持代理运行,我们开发了 ResearchGym,一个提供丰富动作空间、分布式和长期视角执行、异步监控和快照保存的研究环境。我们还实现了一个轻量级 ReAct 代理,将显式推理与可执行计划结合,采用 Claude-4、GPT-5、GLM-4.5 和 Kimi-K2 等前沿模型。我们的实验表明,尽管前沿模型在代码驱动的研究任务中显示出前景,但在脆弱的算法相关任务和长期决策中仍然困难,如冲动、资源管理不善和过度依赖模板化推理。此外,代理要在 InnovatorBench 上实现最佳性能需要超过 11 小时,凸显了该基准的难度,并显示出其成为下一代基于代码的研究基准的潜力。

关键词

引用

@article{arxiv.2510.27598,
  title  = {InnovatorBench: Evaluating Agents' Ability to Conduct Innovative LLM Research},
  author = {Yunze Wu and Dayuan Fu and Weiye Si and Zhen Huang and Mohan Jiang and Keyu Li and Shijie Xia and Jie Sun and Tianze Xu and Xiangkun Hu and Pengrui Lu and Xiaojie Cai and Lyumanshan Ye and Wenhong Zhu and Yang Xiao and Pengfei Liu},
  journal= {arXiv preprint arXiv:2510.27598},
  year   = {2025}
}