GPT-4 能否复现实证软件工程研究?
软件工程
2024-06-21 v3 人工智能
摘要
关于生产系统的实证软件工程研究为从业者和研究者带来了对软件工程过程的更好理解。然而,仅研究了生产系统的很小子集,限制了该研究的 impact。尽管软件工程从业者能从其自身数据上复现研究获益,但这带来了一系列挑战,因为执行复现需要对研究方法论及软件工程数据中的细微差别有深入理解。鉴于大语言模型(LLMs,如 GPT-4)在应对软件工程与科学相关任务上展现潜力,这些模型或可帮助复现并由此使实证软件工程研究民主化。本文中,我们考察 GPT-4 在新数据上复现实证软件工程研究的能力。我们研究其揭示实证软件工程研究方法中隐含假设的能力,以及其为七篇实证软件工程论文规划并生成分析流水线代码的能力。我们对 14 名具软件工程研究专长的参与者开展用户研究,由他们评估 GPT-4 从论文中生成的假设与分析计划(即一组模块规格说明)。我们发现 GPT-4 能揭示正确假设,但难以生成适用软件工程数据常识的假设。在对生成代码的手动分析中,我们发现给定方法论子集时,GPT-4 生成代码含有正确的高层逻辑,但代码包含许多小的实现层错误,反映出软件工程知识的缺乏。我们的发现对利用 LLMs 进行软件工程研究以及软件团队中的从业者数据科学家具有启示。
引用
@article{arxiv.2310.01727,
title = {Can GPT-4 Replicate Empirical Software Engineering Research?},
author = {Jenny T. Liang and Carmen Badea and Christian Bird and Robert DeLine and Denae Ford and Nicole Forsgren and Thomas Zimmermann},
journal= {arXiv preprint arXiv:2310.01727},
year = {2024}
}