中文

CodeFuse-CR-Bench:面向 Python 项目的全面性感知代码审查评估基准

软件工程 2025-10-24 v3

摘要

自动化代码审查(CR)是大语言模型(LLM)的关键应用之一,但由于存在“现实鸿沟”,现有基准在使用简化、上下文贫乏的数据对模型进行的子任务评估,阻碍了进展。这未能反映真实世界 CR 的整体、充满多维信息的本质。为弥合这一差距,我们引入 CodeFuse-CR-Bench,这是第一个全面性感知的存储库级 CR 评估基准。CodeFuse-CR-Bench 包含来自 70 个 Python 项目的 601 个高质量实例,覆盖九个拉取请求(PR)问题域,其中每个实例都提供丰富的多方位上下文,包括关联问题、PR 详情和存储库状态,从而实现端到端评估。除非浅显指标外,我们还提出了一种新型评估框架,将位置和语法的规则检查与模型对审查质量的判断相结合。我们首次对最新 LLM 在此全面 CR 任务上的大规模评估。我们的结果确立了关键基线,揭示了以下发现:(1)没有单一的 LLM 在 CR 的所有方面都占据优势;(2)Gemini 2.5 Pro 实现了最高的综合性能;(3)不同的 LLM 对冗余上下文的鲁棒性存在差异。这些发现凸显了进行整体、多维评估的必要性,并为推动真正智能且实用的 CR 助手提供了可操作的见解。

关键词

引用

@article{arxiv.2509.14856,
  title  = {CodeFuse-CR-Bench: A Comprehensiveness-aware Benchmark for End-to-End Code Review Evaluation in Python Projects},
  author = {Hanyang Guo and Xunjin Zheng and Zihan Liao and Hang Yu and Peng DI and Ziyin Zhang and Hong-Ning Dai},
  journal= {arXiv preprint arXiv:2509.14856},
  year   = {2025}
}