HumanEvalComm:评估大语言模型与大语言模型智能体代码生成的沟通能力基准
软件工程
2025-01-29 v3
摘要
大语言模型在代码生成领域执行任务的能力已显著提升。然而,从胜任的程序员到顶尖软件工程师之间仍存在差距。基于顶尖软件工程师常通过提出澄清性问题来减少需求和编码方案中的歧义这一观察,我们认为大语言模型在代码生成任务中也应具备同样的能力。在本工作中,我们对大语言模型在代码生成中的沟通技能进行了基准测试与分析实证研究。我们将大语言模型的沟通技能定义为“当代码生成问题描述存在问题时,能够提出澄清性问题”。我们根据三种问题类型(不一致性、歧义性、不完整性)修改问题描述,创建了新基准HumanEvalComm。我们定义了新的评估指标,如沟通率和优质问题率,并在HumanEvalComm上对不同的代码大语言模型以及一种新的大语言模型智能体方法Okanagan进行了实验,该方法能从代码和描述中识别歧义部分并提出问题,以进一步优化生成的代码。最后,我们通过比较代码大语言模型和Okanagan,结合研究发现讨论了评估结果。
引用
@article{arxiv.2406.00215,
title = {HumanEvalComm: Benchmarking the Communication Competence of Code Generation for LLMs and LLM Agent},
author = {Jie JW Wu and Fatemeh H Fard},
journal= {arXiv preprint arXiv:2406.00215},
year = {2025}
}
备注
42 pages, 6 figures, 16 tables. Published in ACM Transactions on Software Engineering and Methodology (TOSEM)