中文

编程练习的 AI 增强自动纠错:GPT-3.5 效果如何?

计算机与社会 2023-12-15 v1 人工智能 人机交互 软件工程

摘要

及时的形成性反馈被视为有效学习最重要的驱动因素之一。在高等教育的大班教学中,提供及时且个性化的反馈尤其具有挑战性。近来,诸如 GPT-3 等大型语言模型(LLM)已向公众开放,其在代码生成与代码解释等多种任务上展现出令人瞩目的结果。本文探讨了 AI 在提供个性化代码纠正与生成反馈方面的潜力。基于两份不同真实作业的学生提交记录,研究了 AI 辅助电子评估的正确性,以及所生成反馈的故障定位、提示正确性与代码风格建议等特征。结果表明,73% 的提交被正确判定为正确或不正确。在这些案例中,59% 的情况下 GPT-3.5 也成功生成了有效且高质量的反馈。此外,GPT-3.5 在评估中表现出弱点,包括将非真实错误定位为错误,甚至产生幻觉错误。本文讨论了相关启示与潜在的新使用场景。

关键词

引用

@article{arxiv.2311.10737,
  title  = {AI-enhanced Auto-correction of Programming Exercises: How Effective is GPT-3.5?},
  author = {Imen Azaiz and Oliver Deckarm and Sven Strickroth},
  journal= {arXiv preprint arXiv:2311.10737},
  year   = {2023}
}

备注

accepted to the International Journal of Engineering Pedagogy (iJEP; eISSN: 2192-4880)