使用大语言模型对大规模开放在线课程进行评分
计算与语言
2024-12-17 v2 人工智能
摘要
大规模开放在线课程(MOOCs)为全球提供了免费教育。尽管实现了学习的民主化,但这些课程的大规模报名人数使得教师不可能评估每一位学生的写作作业。因此,往往依靠带有简单评分标准的同伴评分成为首选方法。虽然便利,但同伴评分在可靠性和有效性方面往往不足。本研究探讨了使用大语言模型(LLMs)取代 MOOCs 中的同伴评分的可行性。为此,我们采用零样本链思考(ZCoT)提示技术自动化反馈过程,一旦 LLM 为作业赋分。具体而言,为了指示 LLM 进行评分,我们基于 ZCoT 使用三种不同的提示:(1)ZCoT 结合教师提供的正确答案;(2)ZCoT 结合教师提供的正确答案和评分标准;(3)ZCoT 结合教师提供的正确答案和 LLM 生成的评分标准。我们在 18 种不同情景下测试了这些提示,对两种 LLM(GPT-4 和 GPT-3.5)进行测试,涵盖三门 MOOCs:介绍天文学、天体生物学以及天文学史与哲学。我们的结果表明,ZCoT 在辅助教师提供的正确答案和评分标准的情况下,产生的成绩与教师赋分更吻合,优于同伴评分。最终,我们的发现表明,在具有明确评分标准的学科中,自动化评分系统在为全球数以百万计的线上学习者改进学习体验方面具有前景。
引用
@article{arxiv.2406.11102,
title = {Grading Massive Open Online Courses Using Large Language Models},
author = {Shahriar Golchin and Nikhil Garuda and Christopher Impey and Matthew Wenger},
journal= {arXiv preprint arXiv:2406.11102},
year = {2024}
}
备注
Final version; accepted at COLING 2025