评估用于代码审查的大型语言模型
软件工程
2025-05-27 v1 人工智能
摘要
背景:代码审查对软件质量至关重要。近期人工智能的进展使得大型语言模型能够审查和修复代码;现在已有执行这些审查的工具。然而,它们的可靠性和准确性尚未得到系统评估。目的:本研究比较了不同LLMs在检测代码正确性和建议改进方面的性能。方法:我们在492个正确性不同的AI生成代码块,以及来自HumanEval基准的164个标准代码块上测试了GPT4o和Gemini 2.0 Flash。为了客观模拟代码审查任务,我们期望LLMs评估代码正确性并在需要时改进代码。我们用不同配置进行了实验并报告了结果。结果:在提供问题描述的情况下,对于492个正确性不同的代码块,GPT4o和Gemini 2.0 Flash分别有68.50%和63.89%的时间正确分类了代码正确性,并分别有67.83%和54.26%的时间纠正了代码。在没有问题描述的情况下,性能下降。164个标准代码块的结果有所不同,表明性能取决于代码类型。结论:LLM代码审查可以帮助建议改进和评估正确性,但存在输出错误的风险。我们提出了一种包含人类的流程,称为“人在环中的LLM代码审查”,以在降低错误输出风险的同时促进知识共享。
引用
@article{arxiv.2505.20206,
title = {Evaluating Large Language Models for Code Review},
author = {Umut Cihan and Arda İçöz and Vahid Haratian and Eray Tüzün},
journal= {arXiv preprint arXiv:2505.20206},
year = {2025}
}