衡量 LLM 软件工程中的新兴能力:我们离多远?
软件工程
2024-11-28 v1
摘要
大型语言模型(LLM)在多个上下文中的采用引发了对模型规模如何导致行为变化的兴趣,因为 LLM 能 exhibit(表现)其较小规模模型中未观察到的行为。理解这些新兴能力对于推动 LLM 开发并改进其在 diverse(多样化)任务上的可解释性至关重要。然而,是否在软件工程语境下 LLM 表现出真正的涌现现象仍是未探索的主题,因为大多数研究聚焦于 NLP 任务。本文我们调查软件工程语境下的能力涌现。我们提出一种模型无关的管线,用于在三个软件工程任务上评估这一现象。更准确地说,对于每个任务,我们呈现一个案例研究来实例化我们的管线,以分析 CodeGen1-multi 在从 3.5 亿到 16.1 亿参数的四个规模范围内的能力涌现。我们的发现并不提供支持该想法的证据,即模型规模导致所选任务集合中能力涌现。我们希望我们的结果为在软件工程领域更细致地理解 LLM 的涌现能力铺路,指导未来研究聚焦于任务特定的评估,并识别贡献于这一现象的替代因素。我们的工作强调在检验模型行为时任务多样性的重要性,并指出在从 NLP 转向软件工程的可能性受限。
引用
@article{arxiv.2411.17927,
title = {Measuring Emergent Capabilities of LLMs for Software Engineering: How Far Are We?},
author = {Conor O'Brien and Daniel Rodriguez-Cardenas and Alejandro Velasco and David N. Palacio and Denys Poshyvanyk},
journal= {arXiv preprint arXiv:2411.17927},
year = {2024}
}
备注
Submitted for RENE ICPC 2025