中文

通过LLM驱动的代码片段描述生成揭示意图

软件工程 2025-06-19 v1 人工智能

摘要

为代码片段编写文档至关重要,以便确定开发人员和用户应关注的关键区域。例如,包括用例和其他应用程序编程接口(API),对于第三方库尤为重要。随着大型语言模型(LLM)的兴起,关键目标是调查开发人员常使用的描述类型,并评估LLM(本案例中为Llama)能否支持描述生成。我们使用NPM Code Snippets,其中包含185,412个软件包和1,024,579个代码片段。从中,我们使用400个代码片段(及其描述)作为样本。首先,我们的手动分类发现,原始描述的多数(55.5%)突出了基于示例的用法。这一发现强调了清晰文档的重要性,因为一些描述缺乏足够的细节来传达意图。其次,LLM正确识别了大多数原始描述为“示例”(79.75%),这与我们的手动发现相同,表明了概括化倾向。与原始版本相比,产生的描述的平均相似度得分为0.7173,表明相关性很强,但仍有提升空间。得分低于0.9表明存在一定不相关性。我们的结果表明,根据代码片段的任务不同,文档的意图可能不同于为用法、安装或任何库用户的学习示例而编写说明。

关键词

引用

@article{arxiv.2506.15453,
  title  = {Uncovering Intention through LLM-Driven Code Snippet Description Generation},
  author = {Yusuf Sulistyo Nugroho and Farah Danisha Salam and Brittany Reid and Raula Gaikovina Kula and Kazumasa Shimari and Kenichi Matsumoto},
  journal= {arXiv preprint arXiv:2506.15453},
  year   = {2025}
}

备注

6 pages, 3 figures, 4 tables, conference paper