大语言模型能否取代人类评估者?关于软件工程中 LLM 评估器的实证研究
摘要
最近,大语言模型 (LLM) 被部署来解决各种软件工程 (SE) 任务,如代码生成,显著推动了 SE 任务的自动化。然而,评估这些由 LLM 生成的代码和文本的质量仍然具有挑战性。常用的 Pass@k 指标需要大量单元测试和配置好的环境,要求高额劳动力,不适用于评估 LLM 生成的文本。常规指标如 BLEU,仅衡量词汇层面的相似性而非语义相似性,亦受到质疑。为此,一种新趋势即运用 LLM 进行自动评估,称为 LLM-as-a-judge。这些 LLM-as-a-judge 方法被宣称能更模仿人类评估,而无需依赖高质量的参考答案。然而,这些方法在 SE 任务中的人类对齐性尚未探讨。本文我们就 LLM-as-a-judge 方法在评估 SE 任务方面进行经验研究,关注其与人类判断的对齐情况。我们选取七种利用通用 LLM 的 LLM-as-a-judge 方法,以及两款专为评估而微调的 LLM。在生成并手动评分 LLM 对三组最近 SE 数据集(代码翻译、代码生成、代码摘要)的响应后,我们让这些方法对每个响应进行评估。最后,我们将这些方法生成的分数与人类评估进行比较。结果表明,基于输出的方法在代码翻译和生成任务中分别达到与人类分数的 Pearson 相关系数为 81.32 和 68.51,接近人类评估,显著优于 BLEU 等常规指标中的最佳者 ChrF++(分别为 34.23 和 64.92)。此类基于输出的方法让 LLM 直接输出判断,呈现更均衡的得分分布,类似于人类的得分模式。最后,我们提供...
关键词
引用
@article{arxiv.2502.06193,
title = {Can LLMs Replace Human Evaluators? An Empirical Study of LLM-as-a-Judge in Software Engineering},
author = {Ruiqi Wang and Jiyu Guo and Cuiyun Gao and Guodong Fan and Chun Yong Chong and Xin Xia},
journal= {arXiv preprint arXiv:2502.06193},
year = {2025}
}
备注
Accepted by ISSTA 2025: https://conf.researchr.org/details/issta-2025/issta-2025-papers/85/Can-LLMs-replace-Human-Evaluators-An-Empirical-Study-of-LLM-as-a-Judge-in-Software-E