预训练大语言模型 GPT-4 在自动短答案评分中的表现
计算与语言
2023-09-19 v1
摘要
自动短答案评分(Automated Short Answer Grading, ASAG)十余年来一直是机器学习研究的活跃领域。它有望让教育者在人类评分者有限的情况下,对大规模注册课程中的自由形式作答进行评分与反馈。多年来,经过精心训练的模型取得了日益更高的性能。近来,预训练大语言模型(Large Language Models, LLMs)作为通用工具出现,一个引人关注的问题是无额外训练的通用工具与专用模型相比表现如何。我们研究了 GPT-4 在标准基准二分类与三分类数据集 SciEntsBank 和 Beetle 上的表现,除评分学生答案与参考答案一致性的标准任务外,我们还探究了不提供参考答案的情形。我们发现,总体而言,预训练通用 GPT-4 LLM 的性能可与手工设计模型媲美,但逊于经过专门训练的预训练 LLM。
引用
@article{arxiv.2309.09338,
title = {Performance of the Pre-Trained Large Language Model GPT-4 on Automated Short Answer Grading},
author = {Gerd Kortemeyer},
journal= {arXiv preprint arXiv:2309.09338},
year = {2023}
}