中文

细节藏于长尾:长尾代码分布如何影响大语言模型

软件工程 2023-09-08 v1

摘要

基于学习的技术,尤其是面向代码的高级大语言模型(LLM),已在各种软件工程(SE)任务中获得了相当高的人气。然而,现有大多数工作聚焦于设计更好的基于学习的模型,而较少关注数据集的属性。基于学习的模型,包括流行的面向代码的 LLM,严重依赖数据,而数据的属性(例如数据分布)会显著影响其表现。我们对 SE 数据的分布进行了探索性研究,发现此类数据通常遵循偏斜分布(即长尾分布),其中少数类别拥有大量样本,而大量类别仅有极少样本。我们调查了三种不同的 SE 任务,并分析了长尾分布对面向代码的 LLM 性能的影响。实验结果表明,长尾分布对面向代码的 LLM 的有效性有实质性影响。具体而言,与频繁标签的数据样本相比,面向代码的 LLM 在不频繁标签相关的数据样本上表现差 30.0% 至 254.0%。我们的研究增进了对长尾分布对流行面向代码的 LLM 影响的理解,并为未来 SE 自动化的发展提供了见解。

关键词

引用

@article{arxiv.2309.03567,
  title  = {The Devil is in the Tails: How Long-Tailed Code Distributions Impact Large Language Models},
  author = {Xin Zhou and Kisub Kim and Bowen Xu and Jiakun Liu and DongGyun Han and David Lo},
  journal= {arXiv preprint arXiv:2309.03567},
  year   = {2023}
}

备注

13 pages