中文

基于 LLM 的软件仓库挖掘方法学框架

软件工程 2025-08-12 v2

摘要

大型语言模型(LLM)在软件工程研究中的应用日益广泛,为自动化仓库挖掘任务提供了新机遇。然而,尽管 LLM 越来越受欢迎,但其在软件仓库挖掘(MSR)中的方法学整合仍缺乏深入理解。现有研究往往侧重于特定能力或性能基准,对研究人员如何在整个研究流程中使用 LLM 提供的洞见有限。为弥补这一空白,我们在 LLM4MSR 领域开展了一项结合快速审查和问卷调查的混合方法研究。我们调查了(1)方法以及(2)影响该领域研究人员实证严谨性的威胁。我们的发现揭示了 15 种方法学途径、9 个主要威胁和 25 种缓解策略。基于这些发现,我们提出了 PRIMES 2.0,一个精炼的实证框架,分为六个阶段,包含 23 个方法学子步骤,每个步骤都映射到特定威胁和相应的缓解策略,为基于 LLM 的 MSR 研究生命周期提供规范性和自适应支持。我们的工作为基于 LLM 的 MSR 研究建立更透明和可复现的基础做出了贡献。

关键词

引用

@article{arxiv.2508.02233,
  title  = {A Methodological Framework for LLM-Based Mining of Software Repositories},
  author = {Vincenzo De Martino and Joel Castaño and Fabio Palomba and Xavier Franch and Silverio Martínez-Fernández},
  journal= {arXiv preprint arXiv:2508.02233},
  year   = {2025}
}