中文

大型语言模型在静态分析中的涌现:通过微基准测试的初步审视

软件工程 2024-02-28 v1

摘要

大型语言模型(LLM)在软件工程中的应用,特别是在静态分析任务中,代表了该领域的范式转变。本文研究当前LLM在改进Python程序的调用图分析和类型推断中的作用。使用PyCG、HeaderGen和TypeEvalPy微基准测试,我们评估了26个LLM,包括OpenAI的GPT系列和开源模型如LLaMA。我们的研究表明,LLM在类型推断方面显示出有希望的结果,准确率高于传统方法,但在调用图分析方面表现出局限性。这种对比强调了需要对LLM进行专门微调以更好地适应特定静态分析任务。我们的发现为进一步研究将LLM集成到静态分析任务中奠定了基础。

关键词

引用

@article{arxiv.2402.17679,
  title  = {The Emergence of Large Language Models in Static Analysis: A First Look through Micro-Benchmarks},
  author = {Ashwin Prasad Shivarpatna Venkatesh and Samkutty Sabu and Amir M. Mir and Sofia Reis and Eric Bodden},
  journal= {arXiv preprint arXiv:2402.17679},
  year   = {2024}
}

备注

To be published in: ICSE FORGE 2024 (AI Foundation Models and Software Engineering)