中文

用于代码文档生成的大型语言模型比较分析

软件工程 2024-04-30 v2 人工智能

摘要

本文对用于生成代码文档的大型语言模型进行了全面的比较分析。代码文档是软件编写过程的重要组成部分。本文在准确性、完整性、相关性、可理解性、可读性和耗时等各种参数上,对 GPT-3.5、GPT-4、Bard、Llama2 和 Starchat 等模型在不同级别的代码文档上进行了评估。我们的评估采用基于检查表的系统以尽量减少主观性,从而提供更客观的评估。我们发现,除 Starchat 外,所有 LLM 的表现均持续优于原始文档。值得注意的是,与开源/源可用 LLM(即 LLama 2 和 StarChat)相比,闭源模型 GPT-3.5、GPT-4 和 Bard 在各项参数上均表现出更优的性能。考虑到生成所花费的时间,GPT-4 的耗时最长,其次是 Llama2 和 Bard,而 ChatGPT 和 Starchat 的生成时间相当。此外,与内联和函数级文档相比,文件级文档在所有参数上(除耗时外)的表现均明显较差。

关键词

引用

@article{arxiv.2312.10349,
  title  = {A Comparative Analysis of Large Language Models for Code Documentation Generation},
  author = {Shubhang Shekhar Dvivedi and Vyshnav Vijay and Sai Leela Rahul Pujari and Shoumik Lodh and Dhruv Kumar},
  journal= {arXiv preprint arXiv:2312.10349},
  year   = {2024}
}

备注

Under review