用于自动评估学生科学写作的大语言模型应用
计算与语言
2025-01-24 v1
摘要
在大型课程中对正式或非正式学习者的写作进行评估是一个重大挑战。因此,大多数大型课程,特别是科学课程,依赖客观评估工具,如多选选择题 quizzes,这类工具只有一个正确答案。人工智能的快速发展引入了使用大语言模型(LLM)评估学生写作的可能性。我们 conducted了一个实验,使用GPT-4来确定基于LLM的机器学习方法是否能够匹配或超过教师在评估天文学课程中短篇写作作业时的可靠性。实验对象为Coursera平台上的三个大规模开放在线课程(MOOCs)中的成年学习者:一门是天文学,一门是天体生物学,一门是天文学的历史与哲学。结果也适用于大学课程中非科学专业学生,后者的评估内容和方式类似。数据包括来自120名学生对三个课程中12个问题的答案。GPT-4被提供有总体成绩、模型答案和来自三个课程的教师评分标准。除了评估LLM在可靠性方面是否复制了教师的打分外,LLM还被要求生成自己的评分标准。总体而言,LLM在整体和按学生个体方面都比同伴打分更可靠,对于所有三个在线课程都大约匹配教师的打分水平。其意义在于,大语言模型可能很快将被用于学生科学写作的自动化、可靠和可扩展评估。
引用
@article{arxiv.2412.18719,
title = {Using Large Language Models for Automated Grading of Student Writing about Science},
author = {Chris Impey and Matthew Wenger and Nikhil Garuda and Shahriar Golchin and Sarah Stamer},
journal= {arXiv preprint arXiv:2412.18719},
year = {2025}
}
备注
Accepted at IJAIE