中文

为你的进步喝彩!大语言模型(GPT-4)不再难以通过高等教育编程课程考核

计算机与社会 2023-10-05 v1 人工智能 计算与语言 软件工程

摘要

本文研究了大语言模型(LLM)在高等教育入门与中级 Python 编程课程中通过考核的能力的最新发展。ChatGPT 的出现引发了关于其在编程课中潜在用途(如习题生成、代码解释)以及滥用(如作弊)的激烈讨论。近期研究表明,尽管该技术在典型编程课所采用的多种考核工具上表现惊人地好,但其表现通常不足以通过课程。GPT-4 的发布大幅强调了其在处理原本为人类考生设计的考核方面的能力显著改进。本研究是在这一迈向成熟生成式 AI 系统的持续转型背景下的必要分析。具体而言,我们报告了 GPT-4 在三类 Python 课程上的表现,并将其与先前几代 GPT 模型比较,考核内容从简单的多选题(不涉及代码)到分布在多个文件中的复杂编程项目(共计 599 道习题)。此外,我们分析了 GPT-4 处理不佳的考核内容,以理解该模型当前的局限性,以及其利用自动评分器所提供反馈的能力。我们发现,GPT 模型从完全无法通过典型编程课考核(原始 GPT-3)演变为无需人类参与即可自信通过课程(GPT-4)。尽管我们识别出 GPT-4 在处理多选题和编程习题方面的某些局限,但最近几代 GPT 模型跨代改进的速度强烈暗示其有潜力处理高等教育编程课程中几乎任何广泛使用的考核类型。教育者和机构可利用这些发现来调整编程考核的设计,并推动关于应如何更新编程课程以反映近期技术发展的必要讨论。本研究提供证据表明,编程教师需要为一个世界做好准备:在其中存在易于使用、广泛可及的技术,学习者可借其以零付出在今天被视为可行的编程知识与技能考核上取得及格分数。

关键词

引用

@article{arxiv.2306.10073,
  title  = {Thrilled by Your Progress! Large Language Models (GPT-4) No Longer Struggle to Pass Assessments in Higher Education Programming Courses},
  author = {Jaromir Savelka and Arav Agarwal and Marshall An and Chris Bogart and Majd Sakr},
  journal= {arXiv preprint arXiv:2306.10073},
  year   = {2023}
}