中文

评估大语言模型为新手程序员生成代码注释的质量

软件工程 2024-09-24 v1 人工智能 人机交互

摘要

大语言模型(LLM)在为新手程序员生成代码注释方面展现出潜力,但其教育有效性仍有待充分评估。本研究评估了由 GPT-4、GPT-3.5-Turbo 和 Llama2 生成的代码注释的教学质量,并与专家开发的注释进行比较,重点关注其对新手的适用性。通过分析来自 LeetCode 的“简单”级别 Java 解决方案数据集,我们发现 GPT-4 在对初学者至关重要的方面(如清晰度、对初学者的友好度、概念阐释和分步指导)表现出与专家注释相当的质量。GPT-4 在讨论复杂度方面优于 Llama2(卡方值 = 11.40,p = 0.001),并且在 Mann-Whitney U 统计量 = 300.5 和 322.5,p = 0.0017 和 0.0003 的检验下,被认为对初学者的支持度显著高于 GPT-3.5 和 Llama2。本研究突出了 LLM 在生成专为新手程序员定制的代码注释方面的潜力。

关键词

引用

@article{arxiv.2409.14368,
  title  = {Evaluating the Quality of Code Comments Generated by Large Language Models for Novice Programmers},
  author = {Aysa Xuemo Fan and Arun Balajiee Lekshmi Narayanan and Mohammad Hassany and Jiaze Ke},
  journal= {arXiv preprint arXiv:2409.14368},
  year   = {2024}
}