大型语言模型在编程入门教育中的表现:ChatGPT的性能及对评估的启示
软件工程
2023-08-21 v1 人工智能
人机交互
摘要
本文研究了大型语言模型(LLMs)ChatGPT-3.5和GPT-4在解决编程入门任务中的表现。基于该表现,推导了利用LLM的教学场景和评估形式的启示。分析中,从免费站点CodingBat选取了72个面向新手程序员的Python任务。将完整任务描述作为LLM的输入,并使用CodingBat的单元测试对生成的回复进行评估。此外,分析了文本解释与程序代码的普遍可用性。结果显示正确回复率高达94.4%至95.8%,且文本解释与程序代码可靠可用,这为将LLM融入编程教育与评估开辟了新途径。
引用
@article{arxiv.2308.08572,
title = {Large Language Models in Introductory Programming Education: ChatGPT's Performance and Implications for Assessments},
author = {Natalie Kiesler and Daniel Schiffner},
journal= {arXiv preprint arXiv:2308.08572},
year = {2023}
}
备注
10 pages, 1 figure