嵌入方法测度代码生成功能正确性的局限性
软件工程
2024-05-06 v1 人工智能
摘要
从自然语言生成代码的任务近年来因大型语言模型(LLM)的兴起而变得极其流行。然而,由于缺乏可靠的功能正确性度量标准,衡量和跟踪这一进展的努力仍感到受限。虽然像HumanEval这类流行基准测试包含测试案例,以实现对正确性的可靠评估,但收集测试案例需要耗时且需要人工 effort。作为一种替代方案,一些基于参考的评估指标被提出,其中像CodeBERTScore这类嵌入式指标被宣传为与人类偏好和功能正确性高度相关。本文我们分析了嵌入式指标(如CodeBERTScore)在衡量功能正确性和其他有用构造(如编辑 effort)方面的能力,通过分析十个模型在两个流行代码生成基准测试中的输出结果。我们的结果显示,虽然它们与功能正确性之间只有较弱的相关性(0.16),但与编辑 effort 之间高度相关(0.72)。
引用
@article{arxiv.2405.01580,
title = {On the Limitations of Embedding Based Methods for Measuring Functional Correctness for Code Generation},
author = {Atharva Naik},
journal= {arXiv preprint arXiv:2405.01580},
year = {2024}
}