SURGE:大型语言模型作为通用代理代码执行器的潜力
机器学习
2026-05-26 v5 计算与语言
摘要
神经代理模型是数据挖掘中强大且高效的工具。与此同时,大型语言模型(LLMs)在代码相关任务(如生成和理解)上展现了卓越能力。然而,一个同样重要但尚未充分探索的问题是:LLMs 能否作为代码执行预测的代理模型?为系统研究这一问题,我们引入了 SURGE,一个涵盖 1160 个问题的综合基准,覆盖 8 个关键方面:多语言编程任务、竞赛级编程问题、仓库级代码分析、高成本科学计算、时间复杂度密集型算法、有缺陷代码分析、依赖特定编译器或执行环境的程序,以及形式化数学证明验证。通过对 21 个开源和专有 LLMs 的广泛分析,我们考察了规模定律、数据效率和预测准确性。我们的发现揭示了 LLMs 作为计算过程高效代理的可行性的重要见解。该基准和评估框架可在 https://github.com/Imbernoulli/SURGE 获取。
引用
@article{arxiv.2502.11167,
title = {SURGE: On the Potential of Large Language Models as General-Purpose Surrogate Code Executors},
author = {Bohan Lyu and Siqiao Huang and Zichen Liang},
journal= {arXiv preprint arXiv:2502.11167},
year = {2026}
}