大学编程课程中人类、GPT-3.5与GPT-4表现的比较
计算与语言
2024-10-08 v1
摘要
本研究评估了 ChatGPT 变体 GPT-3.5 和 GPT-4 在使用 Python 语言的大学物理编程作业中的表现,包括是否采用提示工程的情况,并将其与纯学生作业以及包含学生和 GPT-4 贡献的混合类别进行比较。我们将 50 份学生提交的作业与 50 份不同类别的 AI 生成作业进行比较,由三位独立评分者进行盲评,共收集了 个数据点。学生的平均得分为 91.9% (SE:0.4),超过了表现最好的 AI 提交类别(即带有提示工程的 GPT-4,得分为 81.1% (SE:0.8)),差异具有统计学意义 (p = )。提示工程显著提高了 GPT-4 (p = ) 和 GPT-3.5 (p = ) 的得分。此外,盲评评分者还需要在从“肯定是 AI”到“肯定是人类”的四点 Likert 量表上猜测提交作业的作者身份。他们准确地识别了作者身份,在被评为“肯定是人类”的作业中有 92.1% 确实由人类撰写。将其简化为“AI”或“人类”的二元分类后,平均准确率达到 85.3%。这些发现表明,虽然 AI 生成的作业质量已接近大学生的水平,但人类评估者通常仍能检测出其作者身份。
引用
@article{arxiv.2403.16977,
title = {A comparison of Human, GPT-3.5, and GPT-4 Performance in a University-Level Coding Course},
author = {Will Yeadon and Alex Peach and Craig P. Testrow},
journal= {arXiv preprint arXiv:2403.16977},
year = {2024}
}
备注
9 pages, 3 figures