揭示开源项目中 ChatGPT 的使用情况:一项基于挖掘的研究
软件工程
2024-02-27 v1
摘要
大型语言模型(LLM)在软件工程社区引起了广泛关注。如今,开发人员有可能通过提供便捷 LLM 接口的工业级工具(如 OpenAI 的 ChatGPT)来利用这些模型。虽然文献已记录了 LLM 在协助开发人员完成多项任务方面的潜力,但缺乏映射软件项目中 LLM 实际使用情况的实证证据。本研究旨在填补这一空白。首先,我们通过匹配可能表明使用 ChatGPT 完成任务的正则表达式,从开源项目中挖掘了 1,501 个提交、拉取请求(PR)和问题。随后,我们手动分析这些实例,剔除假阳性(即提及但未实际使用 ChatGPT 的实例),并对 467 个真阳性实例(165 个提交、159 个 PR、143 个问题)中自动化的任务进行分类。由此形成了一个包含 45 项任务的分类体系,开发人员通过 ChatGPT 自动化这些任务。该分类体系辅以代表性示例,为(i)开发人员提供了如何在工作流中利用 LLM 的宝贵见解,以及(ii)为研究人员提供了开发人员认为可受益于自动化解决方案的任务的清晰概览。
引用
@article{arxiv.2402.16480,
title = {Unveiling ChatGPT's Usage in Open Source Projects: A Mining-based Study},
author = {Rosalia Tufano and Antonio Mastropaolo and Federica Pepe and Ozren Dabić and Massimiliano Di Penta and Gabriele Bavota},
journal= {arXiv preprint arXiv:2402.16480},
year = {2024}
}
备注
Paper accepted for publication at 21st International Conference on Mining Software Repositories (MASR'24)