InnoGym:评估 AI 代理创新潜力的基准测试
计算与语言
2026-03-03 v2 人工智能
计算机视觉与模式识别
机器学习
多智能体系统
摘要
大语言模型和 Agent 在代码生成、数学推理和科学发现方面取得了显著进展。然而,现有基准主要衡量正确性,忽略了解决方案背后方法的多样性。真正的创新不仅取决于产生正确答案,还取决于方法的原创性。我们提出InnoGym,第一个系统性评估 AI 代理创新潜力的基准测试和框架。InnoGym引入两种互补指标:性能提升,衡量对最佳已知解决方案的改进;新颖性,捕捉与先前方法的methodological差异。基准包括18个来自实际工程和科学领域的精选任务,每项任务都经过资源过滤、评估器验证和解决方案收集进行标准化。此外,我们提供iGym,一个用于可重复且长期评估的统一执行环境。大规模实验显示,尽管一些 Agent 产生了新颖的方法,但其缺乏鲁棒性限制了性能提升。这类结果凸显了创造力与有效性之间的关键差距,凸显了需要评估两者的基准测试的需求。
引用
@article{arxiv.2512.01822,
title = {InnoGym: Benchmarking the Innovation Potential of AI Agents},
author = {Jintian Zhang and Kewei Xu and Jingsheng Zheng and Zhuoyun Yu and Yuqi Zhu and Yujie Luo and Lanning Wei and Shuofei Qiao and Lun Du and Da Zheng and Shumin Deng and Huajun Chen and Ningyu Zhang},
journal= {arXiv preprint arXiv:2512.01822},
year = {2026}
}
备注
ICLR 2026