代码堆栈中的 Bug:LLM 能否发现大型 Python 代码堆中的 Bug
人工智能
2024-06-24 v1 软件工程
摘要
针对 Needle-in-a-Haystack (NIAH) 基准的最新研究探索了大型语言模型 (LLM) 在从大型文本文档中检索上下文信息方面的能力。然而,随着大型语言模型越来越多地被集成到软件开发流程中,就需要评估其在基于代码的环境中的性能。随着 LLM 被开发用于程序综合,我们需要确保 LLM 能理解语法并编写语法正确的代码。作为确保 LLM 理解语法的一步,LLM 可被评估其识别和检测语法 Bug 的能力。我们的基准 Bug In The Code Stack (BICS) 旨在评估 LLM 在大型源代码中识别简单语法 Bug 的能力。我们的发现揭示了三个关键见解:(1) 基于代码的环境在检索任务方面的挑战显著超过文本-based 环境;(2) 不同模型之间存在显著的性能差异;(3) 虽然上下文长度的延长与性能下降呈显著相关性,但这种下降在不同模型之间的程度有所不同。
引用
@article{arxiv.2406.15325,
title = {Bug In the Code Stack: Can LLMs Find Bugs in Large Python Code Stacks},
author = {Hokyung Lee and Sumanyu Sharma and Bing Hu},
journal= {arXiv preprint arXiv:2406.15325},
year = {2024}
}
备注
8 pages