中文

一种用于深入分析大型语言模型代码执行推理的工具

软件工程 2025-01-31 v1

摘要

代码执行推理正在成为一种新的非功能性指标,用于评估大型语言模型(LLM)在编程任务中的能力。当前最先进的框架(如 CodeMind 或 REval)和基准测试(如 CruxEval)通常侧重于 LLM 对给定代码的输入/输出或中间变量状态/值在有限程序上的预测。然而,目前尚无工具用于对结果进行更深入的分析。缺乏此类工具会导致关于 LLM 代码执行推理的观察无法推广到更广泛的数据集,从而阻碍了研究社区和实践者设计具备更好代码执行推理能力的下一代 LLM。本文介绍 ExeRScope,一系列工具和启发式方法,用于分析代码执行推理框架的结果,以更好地理解代码属性对所研究基准测试中代码执行推理产生的影响。通过这种工具化,分析可以推广到具有相似属性的代码,而无需临时设计更多基准测试,这种做法既繁琐又耗时。

关键词

引用

@article{arxiv.2501.18482,
  title  = {A Tool for In-depth Analysis of Code Execution Reasoning of Large Language Models},
  author = {Changshu Liu and Reyhaneh Jabbarvand},
  journal= {arXiv preprint arXiv:2501.18482},
  year   = {2025}
}

备注

5 pages