中文

生成式预训练 Transformer(GPT)能否通过高等教育编程课程考核?

人工智能 2023-10-11 v1 计算与语言

摘要

我们评估了生成式预训练 Transformer(GPT)通过高等教育入门与中级 Python 编程课程考核的能力。关于该新兴技术在编程教育中潜在用途(如习题生成、代码解释)与滥用(如作弊)的讨论已愈发热烈,但迄今尚未有在配备多样考核工具的完整编程课程现实背景下对模型能力的严谨分析。我们在三门 Python 课程上评估了 GPT,这些课程采用的考核从简单的多项选择题(不涉及代码)到分布于多个文件的复杂编程项目不等(共计 599 道习题)。此外,我们研究了 GPT 模型是否能及如何成功利用自动评分器提供的反馈。我们发现,当前模型无法通过 Python 编程课程中典型的全部考核(即使在入门模块上也低于 70%)。然而显而易见的是,直接应用这些易获取的模型可使学习者在入门与中级课程中均获得可观的总体可用分数(>55%)。尽管模型展现出包括依据自动评分器反馈修正解法在内的卓越能力,仍存在若干局限(如难以处理需复杂推理步骤链的习题)。期望调整考核方式的教师可利用这些发现,使 GPT 成为学习者的得力助手而非端到端解决方案。

关键词

引用

@article{arxiv.2303.09325,
  title  = {Can Generative Pre-trained Transformers (GPT) Pass Assessments in Higher Education Programming Courses?},
  author = {Jaromir Savelka and Arav Agarwal and Christopher Bogart and Yifan Song and Majd Sakr},
  journal= {arXiv preprint arXiv:2303.09325},
  year   = {2023}
}

备注

7 pages. arXiv admin note: text overlap with arXiv:2303.08033