中文

ML Research Benchmark:机器学习研究基准

人工智能 2024-10-31 v1

摘要

人工智能智能体在跨领域执行复杂任务方面的能力日益增强。随着这些智能体的进步,越来越需要精确衡量和基准测试其能力,尤其是在加速人工智能研发方面。当前的基准测试侧重于通用机器学习任务,但缺乏用于评估 AI 智能体解决 AI 领域研究级问题和竞赛级挑战能力的综合评估方法。我们提出了 ML Research Benchmark(MLRB),它包含 7 个源自近期机器学习会议轨道的竞赛级任务。这些任务涵盖了 AI 研究人员通常从事的活动,包括模型训练效率、有限数据上的预训练、领域特定微调和模型压缩。本文引入了一个新颖的基准,并使用由前沿模型(包括 Claude-3 和 GPT-4o)驱动的智能体框架对其进行评估。结果表明,Claude-3.5 Sonnet 智能体在我们的基准测试中表现最佳,在规划与开发机器学习模型方面表现出色。然而,两个受测智能体都难以执行非平凡的研究迭代。我们观察到不同任务间的性能差异显著,这凸显了 AI 开发的复杂性以及创建通用智能体框架所面临的挑战。虽然当前的 AI 智能体能够成功遵循复杂指令并产生基线结果,但它们仍达不到高级 AI 研究所需的能力。ML Research Benchmark 为在反映真实世界 AI 研究挑战的任务上评估和比较 AI 智能体提供了一个有价值的框架。

关键词

引用

@article{arxiv.2410.22553,
  title  = {ML Research Benchmark},
  author = {Matthew Kenney},
  journal= {arXiv preprint arXiv:2410.22553},
  year   = {2024}
}