中文

大型语言模型作为 MOOC 评分器

计算与语言 2024-03-04 v4 人工智能

摘要

大规模开放在线课程 (MOOCs) 为拥有计算机和互联网接入权限的任何人开启了免费教育之门。尽管实现了学习的民主化,但这些课程的大规模报名使一名教师几乎不可能评估每个学生的写作作业。因此,采用伙伴评分——通常依据简明的 rubric (评分标准) —— 是首选方法。虽然便利,但伙伴评分在 reliability (可靠性) 和 validity (效度) 方面往往不足。本研究在 18 种不同 setting (设置) 下,探讨了利用大型语言模型 (LLM) 替代 MOOCs 中的伙伴评分的可行性。具体而言,我们聚焦于两款 state-of-the-art LLMs:GPT-4 和 GPT-3.5,涵盖三个不同的课程:Introductory Astronomy (介绍天文学)、Astrobiology (天文生物学) 和 History and Philosophy of Astronomy (天文学史与哲学)。为指示 LLMs,我们使用三种不同的 prompt (提示) 基于对 zero-shot chain-of-thought (零shot 链式思维) 提示技术的变体:将 Zero-shot-CoT 与教师提供的正确答案结合;将 Zero-shot-CoT 与教师制定的答案和 rubric 结合;以及将 Zero-shot-CoT 与教师提供的正确答案和 LLM 生成的 rubric 结合。我们的结果表明,Zero-shot-CoT 在结合教师提供的答案和 rubric 的情况下,产生的成绩与教师的评分更一致,优于伙伴评分。然而,History and Philosophy of Astronomy 课程在评分方面比其他课程更具挑战性。最终,本研究揭示了在尤其是 rubric 明确的科目中自动化评分系统的有前景的方向。

关键词

引用

@article{arxiv.2402.03776,
  title  = {Large Language Models As MOOCs Graders},
  author = {Shahriar Golchin and Nikhil Garuda and Christopher Impey and Matthew Wenger},
  journal= {arXiv preprint arXiv:2402.03776},
  year   = {2024}
}

备注

v1.3 preprint