编程练习的 AI 增强自动纠错:GPT-3.5 效果如何?
计算机与社会
2023-12-15 v1 人工智能
人机交互
软件工程
摘要
及时的形成性反馈被视为有效学习最重要的驱动因素之一。在高等教育的大班教学中,提供及时且个性化的反馈尤其具有挑战性。近来,诸如 GPT-3 等大型语言模型(LLM)已向公众开放,其在代码生成与代码解释等多种任务上展现出令人瞩目的结果。本文探讨了 AI 在提供个性化代码纠正与生成反馈方面的潜力。基于两份不同真实作业的学生提交记录,研究了 AI 辅助电子评估的正确性,以及所生成反馈的故障定位、提示正确性与代码风格建议等特征。结果表明,73% 的提交被正确判定为正确或不正确。在这些案例中,59% 的情况下 GPT-3.5 也成功生成了有效且高质量的反馈。此外,GPT-3.5 在评估中表现出弱点,包括将非真实错误定位为错误,甚至产生幻觉错误。本文讨论了相关启示与潜在的新使用场景。
引用
@article{arxiv.2311.10737,
title = {AI-enhanced Auto-correction of Programming Exercises: How Effective is GPT-3.5?},
author = {Imen Azaiz and Oliver Deckarm and Sven Strickroth},
journal= {arXiv preprint arXiv:2311.10737},
year = {2023}
}
备注
accepted to the International Journal of Engineering Pedagogy (iJEP; eISSN: 2192-4880)