MLE-bench:评估机器学习代理的机器学习工程能力
计算与语言
2025-02-27 v6
摘要
我们介绍 MLE-bench,这是一个用于衡量人工智能代理在机器学习工程方面性能的基准测试。为此,我们从 Kaggle 精选了 75 个与机器学习工程相关的竞赛,构建了一套多样化且具有挑战性的任务,测试真实世界的机器学习工程技能,包括训练模型、准备数据集和运行实验。我们使用 Kaggle 公开的排行榜为每个竞赛建立人类基准。我们使用开源代理框架对 our benchmark 上评估多个前沿语言模型,发现最佳配置——OpenAI 的 o1-preview 配合 AIDE 框架——在 16.9% 的竞赛中至少达到 Kaggle 铜牌水平。除主要结果外,我们还探讨了 AI 代理 various 形式的资源扩缩及来自预训练污染的影响。我们开源了 benchmark 代码(github.com/openai/mle-bench/),以促进未来研究,理解 AI 代理的机器学习工程能力。
引用
@article{arxiv.2410.07095,
title = {MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering},
author = {Jun Shern Chan and Neil Chowdhury and Oliver Jaffe and James Aung and Dane Sherburn and Evan Mays and Giulio Starace and Kevin Liu and Leon Maksin and Tejal Patwardhan and Lilian Weng and Aleksander Mądry},
journal= {arXiv preprint arXiv:2410.07095},
year = {2025}
}
备注
10 pages, 17 pages appendix. Equal contribution by first seven authors, authors randomized. ICLR version