中文

大型语言模型能否作为代码摘要的评估器?

软件工程 2024-12-03 v1

摘要

代码摘要通过将代码片段转换为自然语言描述来促进程序理解和软件维护。多年来,针对这一任务已开发了许多方法,但仍存在一个关键挑战:有效评估生成摘要的质量。虽然人工评估在评估代码摘要质量方面有效,但其工作量大且难以扩展。常用的自动评估指标,如 BLEU、ROUGE-L、METEOR 和 BERTScore,常常无法与人类判断 closely 对齐。本文探讨了大型语言模型(LLM)用于代码摘要评估的潜力。我们提出了 CODERPE(Code Summarization Evaluation Role-Player),一种新颖的方法,通过角色驱动提示来评估生成摘要的质量。具体而言,我们提示一个 LLM 代理扮演多种角色,如代码审阅员、代码作者、代码编辑员和系统分析员。每个角色都跨越诸多关键维度(包括连贯性、一致性、流畅性和相关性)来评估代码摘要的质量。我们进一步通过采用各种提示策略来探讨 LLM 作为评估器的鲁棒性,包括链式思考推理、零样本学习和量身定制的评分表设计。结果表明,LLM 作为代码摘要方法的有效评估器。值得注意的是,我们的 LLM-based 评估器 CODERPE 与人工评估之间实现了 81.59% 的斯佩曼相关系数,净增 17.27%,显著优于现有的 BERTScore 指标。

关键词

引用

@article{arxiv.2412.01333,
  title  = {Can Large Language Models Serve as Evaluators for Code Summarization?},
  author = {Yang Wu and Yao Wan and Zhaoyang Chu and Wenting Zhao and Ye Liu and Hongyu Zhang and Xuanhua Shi and Philip S. Yu},
  journal= {arXiv preprint arXiv:2412.01333},
  year   = {2024}
}