大语言模型与 Stack Overflow 讨论:可靠性、影响与挑战
软件工程
2025-07-10 v2 人工智能
摘要
自 2022 年 11 月发布以来,ChatGPT 对开发者就编程和软件开发进行提问的首要平台 Stack Overflow 产生了巨大冲击。ChatGPT 展示了对技术问题生成即时、类人回答的能力,在开发者社区中引发了关于生成式 AI 时代下人类驱动平台角色演变的争论。ChatGPT 发布两个月后,Meta 以其自研的大语言模型(LLM)LLaMA 作出回应:竞赛由此开始。我们进行了一项实证研究,分析来自 Stack Overflow 的问题,并使用这些 LLM 来解答它们。通过这种方式,我们旨在 (i) 量化 LLM 回答的可靠性及其长期替代 Stack Overflow 的潜力;(ii) 识别并理解 LLM 失败的原因;(iii) 衡量用户随时间推移在 Stack Overflow 上活动的演变;以及 (iv) 对不同的 LLM 进行比较。我们的实证结果明确显示:ChatGPT 和 LLaMA 挑战了人类专业知识,但在某些领域并未超越它,同时观察到用户发帖活动显著下降。此外,我们还讨论了我们的发现对新型 LLM 使用和开发的影响,并为用户和研究人员未来面临的挑战提供了指导。
引用
@article{arxiv.2402.08801,
title = {LLMs and Stack Overflow Discussions: Reliability, Impact, and Challenges},
author = {Leuson Da Silva and Jordan Samhi and Foutse Khomh},
journal= {arXiv preprint arXiv:2402.08801},
year = {2025}
}
备注
63 pages, 11 figures