中文

LLM 生成 Python 代码低效性的分类体系

软件工程 2025-08-12 v3

摘要

大型语言模型 (LLMs) 被广泛用于自动化代码生成,并取得了可喜的成果。尽管先前的研究评估了 LLM 生成的代码并识别了各种质量问题——例如冗余、可维护性差和性能次优——但对这些低效性的系统理解和分类仍未被探索。缺乏此类知识,从业者难以针对实际应用优化 LLM 生成的代码,从而限制了其采用。本研究还可指导改进代码 LLM,提升代码生成的质量和效率。因此,在本研究中,我们实证调查了最先进模型(即 CodeLlama、DeepSeek-Coder 和 CodeGemma)生成代码中的低效性。为此,我们分析了 HumanEval++ 数据集中的 492 个生成代码片段。然后,我们构建了 LLM 生成代码低效性的分类体系,包括 5 个类别(通用逻辑、性能、可读性、可维护性和错误)以及 19 个低效性子类别。随后,我们通过对 58 名 LLM 从业者和研究人员的在线调查验证了所提出的分类体系。我们的研究表明,逻辑和性能相关的低效性最普遍、最相关且最频繁地共现,并影响整体代码质量的低效性。我们的分类体系为评估 LLM 生成代码的质量提供了结构化基础,并指导未来研究以提高代码生成效率。

关键词

引用

@article{arxiv.2503.06327,
  title  = {A Taxonomy of Inefficiencies in LLM-Generated Python Code},
  author = {Altaf Allah Abbassi and Leuson Da Silva and Amin Nikanjam and Foutse Khomh},
  journal= {arXiv preprint arXiv:2503.06327},
  year   = {2025}
}