噪声过大而无法学习:提升代码审查评论生成的数据质量
软件工程
2025-02-07 v2
摘要
代码审查是软件开发中的重要实践,但耗时且需要大量精力。尽管开源数据集已被用于训练自动化代码审查任务(包括审查评论生成)的神经模型,但这些数据集包含大量噪声评论(例如,模糊或不可操作的反馈),即使使用基于启发式规则和机器学习方法的清洗手段,这些噪声依然存在。此类残留噪声可能导致模型生成低质量的审查评论,然而去除它们需要对代码变更和自然语言评论进行复杂的语义理解。本文中,我们研究了此类噪声对审查评论生成的影响,并提出了一种使用大语言模型(LLMs)进一步清洗这些数据集的新方法。基于对大规模代码审查数据集的实证研究,我们的 LLM 方法在检测有效评论方面达到了 66-85% 的精确率。使用预测的有效评论微调最先进的代码审查模型(清洗后的模型),可以生成与有效人工评论相似度比原始模型高 13.0% - 12.4% 的审查评论。我们还发现,清洗后的模型能生成比原始模型信息量更丰富、更相关的评论。我们的发现强调了数据集质量对审查评论生成性能的关键影响。我们倡导进一步研究清洗训练数据,以提升自动化代码审查的实用性和质量。
引用
@article{arxiv.2502.02757,
title = {Too Noisy To Learn: Enhancing Data Quality for Code Review Comment Generation},
author = {Chunhua Liu and Hong Yi Lin and Patanamon Thongtanunam},
journal= {arXiv preprint arXiv:2502.02757},
year = {2025}
}
备注
The paper is published at the International Conference on Mining Software Repositories (MSR2025)