中文

研究大语言模型在闭源与开源数据上的性能

软件工程 2024-02-26 v1 机器学习

摘要

大语言模型 (LLM) 在软件工程实践中得到了广泛应用。这些模型极度依赖数据,且主要在使用宽松许可证分发的开源 (OSS) 代码上进行训练。然而在实际应用中,大量软件开发仍发生在营利/专有领域,其中的开发代码从未也永远不会进入公共领域;因此,许多开发者在模型可能不熟悉待开发代码的环境下进行工作并使用 LLM。在此类场景中,LLM 的表现是否能像在 OSS 代码上一样出色?如果不能,差异何在?当性能存在差异时,可能的原因是什么,是否有变通方案?在本文中,我们利用来自 Microsoft 的专有闭源软件数据对此问题进行考察,其中大多数专有代码为 C# 和 C++。我们发现,C# 的性能从 OSS 代码到专有代码变化不大,但 C++ 的性能显著下降;我们发现这种差异归因于标识符的不同。我们还发现,在某些情况下,可以通过上下文学习 (in-context learning) 有效地缓解部分性能下降。

关键词

引用

@article{arxiv.2402.15100,
  title  = {Studying LLM Performance on Closed- and Open-source Data},
  author = {Toufique Ahmed and Christian Bird and Premkumar Devanbu and Saikat Chakraborty},
  journal= {arXiv preprint arXiv:2402.15100},
  year   = {2024}
}