中文

一尺寸不适用:探讨困惑度在检测 LLM 生成代码中的有效性

软件工程 2025-07-16 v2

摘要

大型语言模型生成的代码(LLMgCode)在软件开发领域日益普及。与人类编写的代码(HaCode)相比,LLMgCode 更容易出现质量问题。LLMgCode 常常与 HaCode 混合编写代码变更,却仅由人类开发者签名,却未经过仔细审查。为此,提出了许多自动化方法来检测 LLMgCode,其中基于困惑度的方法(PERPLEXITY)是当前最先进的方法。然而,PERPLEXITY 的有效性评估目前仅关注检测准确性。但是否在更广泛的现实评估场景中效果良好尚不清楚。为此,我们开展了一系列实验,比较 PERPLEXITY 与基于特征和预训练的方法,从三个角度进行评估:检测准确性、检测速度和泛化能力。实验结果表明,PERPLEXITY 在泛化能力上表现最佳,但检测准确性和检测速度有限。基于此,我们讨论了 PERPLEXITY 的优势与局限性,例如 PERPLEXITY 不适用于高级编程语言。最后,我们提供了改进 PERPLEXITY 并在实际中应用的建议。作为首次大规模调查 LLMgCode 检测,本文为未来的改进提供了广泛的发现。

关键词

引用

@article{arxiv.2412.16525,
  title  = {One Size Does Not Fit All: Investigating Efficacy of Perplexity in Detecting LLM-Generated Code},
  author = {Jinwei Xu and He Zhang and Yanjing Yang and Lanxin Yang and Zeru Cheng and Jun Lyu and Bohan Liu and Xin Zhou and Alberto Bacchelli and Yin Kia Chiam and Thiam Kian Chiew},
  journal= {arXiv preprint arXiv:2412.16525},
  year   = {2025}
}

备注

This article has been accepted by ACM Transactions on Software Engineering and Methodology (TOSEM)