深度评估代码审查生成方法:超越词汇相似性
软件工程
2025-01-10 v1
摘要
代码审查是确保软件项目质量的标准实践,近期研究聚焦于自动化代码审查。尽管已取得显著进展,但自动化审查评估仍鲜受探讨,现有方法与指标常不准确。当前指标如 BLEU 主要依赖生成审查与参考审查之间的词汇相似性,但这类指标倾向于低估以不同方式表达预期问题的审查结果。在本文中,我们探索了基于语义相似性的审查评估方法。我们首先构建名为 \textit{GradedReviews} 的基准数据集,收集开源项目的真实审查,生成基于最新方法的审查,并进行人工质量评估。随后评估现有审查评估指标,揭示其局限性。为克服这些局限,我们提出两种新型语义方法:一种是通过深度学习模型将生成审查与参考转化为数字向量,再通过余弦相似度衡量语义相似性;另一种是基于生成审查与参考生成提示,请 ChatGPT 根据明确定义的标准对生成审查进行评分。我们在 \textit{GradedReviews} 基准上的评估表明,所提语义方法显著优于现有 SOTA 指标,使人类评分与结果分数之间的相关系数从 0.22 提升至 0.47。
引用
@article{arxiv.2501.05176,
title = {Deep Assessment of Code Review Generation Approaches: Beyond Lexical Similarity},
author = {Yanjie Jiang and Hui Liu and Tianyi Chen and Fu Fan and Chunhao Dong and Kui Liu and Lu Zhang},
journal= {arXiv preprint arXiv:2501.05176},
year = {2025}
}