中文

面向函数和项目级代码生成任务的高效交互策略实验分析

软件工程 2025-08-07 v1 人工智能

摘要

大型语言模型(LLM)在软件工程任务的生产性完成方面取得了显著进展。然而,针对高效提示技术的研究往往采用有限的问题空间,主要关注众所周知的提示模式,主要针对函数级的软件工程实践。我们识别出实际工作流程中存在的显著差距,这些差距涉及超出类级(如多类依赖)的复杂性,以及可以影响人类-LLM 交互(HLI)过程的不同特征。在此基础上,我们设计了一个综合分析 HLI 特征以提高代码生成生产力的实验。我们的研究提出了两个项目级基准任务,超越函数级评估。我们邀请了来自不同背景的 36 名参与者,通过使用特定的提示模式与 GPT 助手进行交互以完成分配任务。我们还通过分析屏幕录像和 GPT 聊天记录来考察参与者的体验及其在交互过程中的行为特征。我们的统计和实证调查揭示了:(1)其中三项 15 项 HLI 特征对代码生成的生产力有显著影响;(2)五项主要的提高 HLI 过程生产力的指南;(3)一种包含 29 种运行时和逻辑错误的分类,这些错误可以在 HLI 过程中发生,并附上建议的缓解计划。

关键词

引用

@article{arxiv.2508.04125,
  title  = {Experimental Analysis of Productive Interaction Strategy with ChatGPT: User Study on Function and Project-level Code Generation Tasks},
  author = {Sangwon Hyun and Hyunjun Kim and Jinhyuk Jang and Hyojin Choi and M. Ali Babar},
  journal= {arXiv preprint arXiv:2508.04125},
  year   = {2025}
}

备注

The benchmark repository has not been publicly released yet due to the IP policy in our institutions. If you would like to use the benchmark or collaborate on extension, please contact "[email protected]"