CRScore:将自动化代码审查评论 grounded 在代码声明和问题中的度量
软件工程
2025-03-18 v2 人工智能
计算与语言
摘要
自动化代码审查的任务最近从机器学习社区获得了很多关注。然而,当前的审查评论评估指标依赖于与给定代码更改(也称为diff)的人工编写参考进行比较。此外,代码审查是一个一对多的问题,类似于生成和摘要,存在许多“有效审查”。因此,我们开发了CRScore——一种无参考的度量方法,用于衡量诸如简洁性、全面性和相关性等审查质量维度。我们设计CRScore以一种以 LLM 和静态分析器检测代码中可能存在的声明和潜在问题为基础来评估审查。我们展示了CRScore能够产生有效的、细粒度的审查质量评分,这些评分在开源指标中与人类判断对齐度最高(0.54斯皮尔曼相关系数),且比参考基于的指标更敏感。我们还发布了一个包含2.9k人工标注的审查质量评分语料库,用于支持机器生成和GitHub审查评论的自动化指标开发。
引用
@article{arxiv.2409.19801,
title = {CRScore: Grounding Automated Evaluation of Code Review Comments in Code Claims and Smells},
author = {Atharva Naik and Marcus Alenius and Daniel Fried and Carolyn Rose},
journal= {arXiv preprint arXiv:2409.19801},
year = {2025}
}