关于商业 LLM 在实证软件工程研究中的可重复性的反思
软件工程
2025-11-18 v3 人工智能
摘要
大型语言模型(LLM)在产业和学术界广泛关注。学术界对LLM的关注度也体现在过去几年发表的论文数量上。例如,仅ICSE 2024的425篇论文中就有78篇涉及LLM实验。使用LLM进行实证研究仍然具有挑战性,这引发了关于如何实现可重复结果的问题,面向研究者和实践者。掌握当前研究结果的可重复性程度以及可能阻碍可重复性的因素,是本项工作的范围之一。我们贡献了对LLM导向研究可重复性的分析,提供了影响可重复性因素的见解,并讨论了如何改进当前状态的建议。具体而言,我们研究了在ICSE 2024和ASE 2024上发表的85篇描述LLM导向研究的文章。其中,18篇提供了研究文物并使用了OpenAI模型。我们尝试复制这18项研究。在18项研究中,仅有5项描述足够完整且可执行。对于这5项研究,我们无法完全复制结果。有2项似乎是部分可重复的,而3项似乎不可重复。我们的结果不仅凸显了需要更严格的研究文物评估的需求,也凸显了需要更稳健的研究设计以确保未来出版物具有可重复性的需求。
引用
@article{arxiv.2510.25506,
title = {Reflections on the Reproducibility of Commercial LLM Performance in Empirical Software Engineering Studies},
author = {Florian Angermeir and Maximilian Amougou and Mark Kreitz and Andreas Bauer and Matthias Linhuber and Davide Fucci and Fabiola Moyón C. and Daniel Mendez and Tony Gorschek},
journal= {arXiv preprint arXiv:2510.25506},
year = {2025}
}