中文

面向软件工程的 LLM 评判器:文献综述、愿景与前路

软件工程 2025-10-29 v1

摘要

大型语言模型 (LLM) 的快速集成已彻底改变了软件工程中的代码生成等任务,产生了大量软件制品。这种激增暴露出一个关键瓶颈:缺乏可扩展、可靠的方法来评估这些输出。人类评估成本高昂且耗时,而传统自动化指标如 BLEU 无法捕捉细微的质量方面。在此背景下,LLM 作为评判器范式——即使用 LLM 进行自动化评估——应运而生。该方法利用 LLM 的先进推理能力,提供了一条在自动化规模下实现类人细微差别的路径。然而,LLM 作为评估器在软件工程中的研究仍处于早期阶段。本篇前瞻性的 SE 2030 论文旨在引导社区推进 LLM 作为评估器以评估 LLM 生成的软件制品。我们提供了现有 SE 研究的文献综述,分析了其局限性,确定了关键研究空白,并提出了详细的路线图。我们设想这些框架将成为可靠、稳健且可扩展的人类替代品,能够在 2030 年前实现一致的、多方面的制品评估。我们的工作旨在促进 LLM 作为评估器框架的研究和采纳,从而提高软件制品评估的可扩展性。

关键词

引用

@article{arxiv.2510.24367,
  title  = {LLM-as-a-Judge for Software Engineering: Literature Review, Vision, and the Road Ahead},
  author = {Junda He and Jieke Shi and Terry Yue Zhuo and Christoph Treude and Jiamou Sun and Zhenchang Xing and Xiaoning Du and David Lo},
  journal= {arXiv preprint arXiv:2510.24367},
  year   = {2025}
}