中文

从 GPT-3 到 GPT-4:大语言模型回答高等教育编程类选择题效能的演变

计算机与社会 2023-11-17 v1

摘要

我们探究了三种生成式预训练 Transformer(GPT)模型在为高等教育中入门与中级 Python 编程课程选择题(MCQ)生成答案方面效能的演变。我们聚焦于这些模型在 ChatGPT 发布前(2022年11月)、发布时以及当前(即 2023年8月)的能力差异。近期研究已证实,随着更新更强模型的发布,OpenAI 的 GPT 模型处理原本为人类设计的测评的能力持续提升。然而,这些模型在推理和/或分析编程选择题方面的能力及局限性的质性差异尚未得到充分探索。我们在来自三门 Python 课程的 formative 与 summative 选择题测评(530 道题)上评估了 OpenAI 的三种 GPT 模型,重点关注后续模型演变效能中的质性差异。本研究进一步提供了证据与见解,揭示了当前发展的轨迹:已然存在一种技术,学生可借此在如今被视为可行的编程知识与技能测评中毫不费力地获得及格分数。教育者及教育机构可利用本研究更好地理解近期技术发展,从而调整编程测评的设计,并推动关于未来编程课程测评应如何更新的必要讨论。

关键词

引用

@article{arxiv.2311.09518,
  title  = {From GPT-3 to GPT-4: On the Evolving Efficacy of LLMs to Answer Multiple-choice Questions for Programming Classes in Higher Education},
  author = {Jaromir Savelka and Arav Agarwal and Christopher Bogart and Majd Sakr},
  journal= {arXiv preprint arXiv:2311.09518},
  year   = {2023}
}

备注

arXiv admin note: text overlap with arXiv:2303.08033, arXiv:2306.10073