中文

前LLM与LLM时代代码审查基准与评估实践综述

软件工程 2026-02-17 v1

摘要

代码审查是现代软件工程中的一项关键实践,它帮助开发者及早发现缺陷、提高代码质量并促进知识共享。随着大型语言模型 (LLM) 的快速发展,越来越多的研究探索了代码审查的自动化支持。然而,由于缺乏对现有基准和评估实践的系统性理解,该领域的进展受到阻碍。当前的代码审查数据集分散、设计差异很大,并且对于实际评估了哪些审查能力提供的见解有限。在本文中,我们对跨越前LLM和LLM时代(2015-2025年)的代码审查基准进行了全面综述。我们分析了99篇研究论文(58篇前LLM时代和41篇LLM时代),并提取了关键元数据,包括数据集、评估指标、数据源和目标任务。基于此分析,我们提出了一个多层次分类法,将代码审查研究组织为五个领域和18个细粒度任务。我们的研究揭示了向端到端生成式同行评审的明显转变、多语言覆盖范围的增加以及独立变更理解任务的减少。我们进一步指出了当前基准的局限性,并概述了未来方向,包括更广泛的任务覆盖、动态运行时评估以及分类法引导的细粒度评估。本综述为开发更现实、更全面的基于LLM的代码审查基准提供了结构化基础。

关键词

引用

@article{arxiv.2602.13377,
  title  = {A Survey of Code Review Benchmarks and Evaluation Practices in Pre-LLM and LLM Era},
  author = {Taufiqul Islam Khan and Shaowei Wang and Haoxiang Zhang and Tse-Hsun Chen},
  journal= {arXiv preprint arXiv:2602.13377},
  year   = {2026}
}