中文

如何评判?——针对初学者编程下一步提示的人类专家判断

计算机与社会 2025-06-03 v1 人机交互

摘要

动机:学习编程的学生常会陷入停滞状态,无法继续前进。自动生成的下一步提示可帮助他们取得进展并支持学习。了解何为优秀提示或劣质提示,以及如何为初学者编程工具自动生成优质提示(例如使用大语言模型 LLM)至关重要。方法与参与者:我们招募了来自世界各地的 44 名 Java 教育者参与在线研究。我们使用真实的学生代码状态作为提示生成场景。参与者采用比较判定技术对一组来自大语言模型(LLM)和五位经验丰富的人类教育者生成的下一步 Java 提示进行排序。参与者在不知晓提示生成方式的情况下对提示进行排序。发现:我们发现大语言模型在为编程初学者生成高质量下一步提示方面存在显著差异,GPT-4 在所测试的其他模型中表现突出。在采用恰当提示设计时,GPT-4 在生成教育上有价值的提示方面甚至超越了人类专家。多阶段提示被证明是最有效的大语言模型提示。我们发现,优秀提示的两个最重要因素是长度(80--160 词最佳)和阅读水平(美国九年级或以下最佳)。提供解决问题的备选方法被视为不佳,且发现情感表达没有影响。结论:在大语言模型表现于人类专家之上的情况下,自动生成这些提示立即可行。仅最佳提示才能实现此效果,表明学生自行操作可能难以获得相同收益。因此,提示任务应嵌入专家设计的工具中。

关键词

引用

@article{arxiv.2411.18151,
  title  = {Howzat? Appealing to Expert Judgement for Evaluating Human and AI Next-Step Hints for Novice Programmers},
  author = {Neil C. C. Brown and Pierre Weill-Tessier and Juho Leinonen and Paul Denny and Michael Kölling},
  journal= {arXiv preprint arXiv:2411.18151},
  year   = {2025}
}

备注

36 pages, 14 figures, 7 tables