什么特征使 ChatGPT 在软件问题解决中有效?关于 GitHub 问题中任务、项目和对话信号的实证研究
软件工程
2025-11-25 v2
摘要
对话型大型语言模型在问题解决任务中被广泛使用。然而,並非所有开发人员-LLM 对话对于有效的问题解决都是有帮助的。本文分析了 686 份开发人员-ChatGPT 对话,这些对话在 GitHub 问题线程中共享,以识别使这些对话对问题解决有效的特征。首先,我们分析对话及其对应的问题,以区分有帮助和不 helpful 的对话。我们通过对开发人员寻求帮助的任务类型进行分类,以更好地了解 ChatGPT 在哪些情境下最有效。接下来,我们检查各种对话、项目和问题相关的指标,以揭示有帮助对话的因素。最后,我们确定不 helpful ChatGPT 回应的常见不足之处,以突出可以为设计更有效的开发人员面向工具提供信息的领域。我们发现,只有 62% 的 ChatGPT 对话对成功的问题解决是有帮助的。ChatGPT 在代码生成和工具/库/API 推荐方面最有效,但在代码解释方面则感到挑战。有帮助的对话倾向于较短、更易读,并且表现出更强的语义和语言一致性。较大的、较有影响力的项目和经验丰富的开发人员从 ChatGPT 中受益更多。在问题层面,ChatGPT 在较简单的问题上表现最佳,此类问题开发人员活动有限,解决速度更快,通常是范围明确的任务,如编译错误。最常见的不 helpful ChatGPT 回应的不足包括提供错误信息和不完整性。我们的发现具有广泛的含义,包括为开发人员在问题解决中有效地与之交互提供指导,为开发支持最佳提示设计的工具或框架提供信息,并为针对问题解决任务进行微调提供见解。
引用
@article{arxiv.2506.22390,
title = {What Characteristics Make ChatGPT Effective for Software Issue Resolution? An Empirical Study of Task, Project, and Conversational Signals in GitHub Issues},
author = {Ramtin Ehsani and Sakshi Pathak and Esteban Parra and Sonia Haiduc and Preetha Chatterjee},
journal= {arXiv preprint arXiv:2506.22390},
year = {2025}
}
备注
Accepted for publication in Empirical Software Engineering (EMSE), 2025