研究通过人工和自动化代码审查推荐的质量改进
软件工程
2026-02-13 v1
摘要
已经提出了几种基于深度学习(DL)的技术来自动化代码审查。然而,尚不清楚这些方法能在多大程度上像人类审查者一样推荐质量改进。我们研究了人类执行的代码审查与由DL模型自动生成的代码审查之间的异同,使用ChatGPT-4作为后者的代表。具体来说,我们进行了一项基于挖掘的研究,收集并手动检查了人类审查者在240个拉取请求中发布的739条评论,以建议代码更改。手动检查旨在对人类审查者推荐的质量改进类型进行分类(例如,重命名变量/常量)。然后,我们要求ChatGPT对相同的拉取请求进行代码审查,并将其推荐的质量改进与人类审查者建议的进行比较。我们表明,虽然平均而言,ChatGPT倾向于推荐比人类审查者更多的代码更改(约2.4倍),但它只能发现人类报告的质量问题的10%。然而,LLM生成的额外评论中约有40%指出了有意义的质量问题。简而言之,我们的发现显示了人工和基于AI的代码审查的互补性。这一发现表明,在其当前状态下,基于DL的代码审查可以作为人类审查之外的进一步质量检查,但不应被视为人类审查的有效替代品,也不应被视为节省代码审查时间的手段,因为人类审查者仍然需要执行他们的手动检查,同时还要验证基于DL的技术报告的质量问题。
引用
@article{arxiv.2602.11925,
title = {Studying Quality Improvements Recommended via Manual and Automated Code Review},
author = {Giuseppe Crupi and Rosalia Tufano and Gabriele Bavota},
journal= {arXiv preprint arXiv:2602.11925},
year = {2026}
}
备注
Accepted at the 34th International Conference on Program Comprehension (ICPC 2026)