Rocks 编码而非开发:一项以人为中心、关于大语言模型支持软件工程任务的实验评估
软件工程
2024-02-22 v3 人工智能
摘要
近年来,基于大语言模型(LLM)的生成式人工智能因其在多个领域令人印象深刻的高质量表现而势头强劲,特别是在 ChatGPT 发布之后。许多人认为,它们有潜力在软件开发中执行通用问题解决任务并取代人类软件开发者。然而,目前缺乏对这些 LLM 技术在完成软件开发任务方面能力的严肃调查。在一项包含 109 名参与者的受控 2 x 2 被试间实验中,我们考察了与 ChatGPT 协作在编码任务和典型软件开发任务中是否有益以及有益程度如何,并研究了人们如何与 ChatGPT 协作。我们发现,虽然 ChatGPT 在解决简单编码问题时表现良好,但其在支持典型软件开发任务方面的表现并不理想。我们还观察了参与者与 ChatGPT 之间的交互,并发现了交互与结果之间的关系。因此,我们的研究提供了关于真实开发者使用 ChatGPT 完成软件工程任务的第一手见解,并激发了对新型交互机制的需求,以帮助开发者有效地与大语言模型协作从而实现预期结果。
引用
@article{arxiv.2402.05650,
title = {Rocks Coding, Not Development--A Human-Centric, Experimental Evaluation of LLM-Supported SE Tasks},
author = {Wei Wang and Huilong Ning and Gaowei Zhang and Libo Liu and Yi Wang},
journal= {arXiv preprint arXiv:2402.05650},
year = {2024}
}
备注
The paper has been accepted by FSE