LMR-BENCH:评估LLM代理复现语言建模研究能力的基准
软件工程
2025-06-24 v1 人工智能
摘要
大型语言模型(LLM)代理已在推动科学发现方面显示出惊人的潜力。然而,其在复现NLP领域研究论文中的代码方面的能力尚未得到充分探索。这一任务包括对抽象概念进行智力综合以及理解包含相互关联文件的数据仓库的复杂推理挑战。针对这一差距,我们提出LMR-BENCH,一个旨在系统评估LLM代理在语言建模研究中复现代码能力的基准。该基准包含来自过去五年内来自顶级NLP会议的23篇研究论文中提炼出的28个代码复现任务,涵盖九个基本类别。模型将接收研究论文、包含一个或多个被掩码函数的数据仓库以及实现这些函数的指令。我们在标准提示和LLM代理设置下对最先进的LLMs进行大规模实验,评估单位测试的准确性,并进行基于LLM的代码正确性评估。实验结果表明,即便是最先进的模型在科学推理和代码综合方面仍存在持续的局限性,这突显了LLM代理在自主复现科学研究方面的关键缺口。
引用
@article{arxiv.2506.17335,
title = {LMR-BENCH: Evaluating LLM Agent's Ability on Reproducing Language Modeling Research},
author = {Shuo Yan and Ruochen Li and Ziming Luo and Zimu Wang and Daoyang Li and Liqiang Jing and Kaiyu He and Peilin Wu and George Michalopoulos and Yue Zhang and Ziyang Zhang and Mian Zhang and Zhiyu Chen and Xinya Du},
journal= {arXiv preprint arXiv:2506.17335},
year = {2025}
}