中文

自动化 LLM Speedrunning Benchmark:复现 NanoGPT 改进

人工智能 2025-07-02 v2 计算与语言 机器学习

摘要

大型语言模型(LLMs)的快速发展有潜力有助于科学进步。实现这一目标的关键能力是能够复现现有工作的能力。为评估 AI 代理在活跃研究领域复现结果的能力,我们引入了 Automated LLM Speedrunning Benchmark,借助来自 NanoGPT speedrun 社区贡献,后者旨在最短时间内训练 GPT-2 模型。每个 speedrun 任务为 agent 提供前一记录的训练脚本,或可选搭配三种 hint 格式之一,从 pseudocode 到类似论文的新记录改进描述。记录设计执行速度快,speedrun 改进涵盖多样代码层面变更,从高级算法进步到硬件感知优化。这些特征使该基准对提升 LLM 训练的前沿问题既可及又真实。我们发现,近期的推理 LLMs 结合 SOTA scaffolds 在本基准中难以复现即使已知的创新,即便提供详细的 hint。因此,我们的基准为 LLM 自动化科学复现提供一种简单且未饱和的度量,这是自主研究代理所必需的(但非充分)技能。

关键词

引用

@article{arxiv.2506.22419,
  title  = {The Automated LLM Speedrunning Benchmark: Reproducing NanoGPT Improvements},
  author = {Bingchen Zhao and Despoina Magka and Minqi Jiang and Xian Li and Roberta Raileanu and Tatiana Shavrina and Jean-Christophe Gagnon-Audet and Kelvin Niu and Shagun Sodhani and Michael Shvartsman and Andrei Lupu and Alisia Lupidi and Edan Toledo and Karen Hambardzumyan and Martin Josifoski and Thomas Foster and Lucia Cipolina-Kun and Abhishek Charnalia and Derek Dunfield and Alexander H. Miller and Oisin Mac Aodha and Jakob Foerster and Yoram Bachrach},
  journal= {arXiv preprint arXiv:2506.22419},
  year   = {2025}
}