迈向可扩展的自动评分:利用大语言模型进行工程概念问题评估
计算机与社会
2024-11-07 v1
摘要
本研究探讨了使用大语言模型(LLMs),特别是GPT-4o(ChatGPT),对机械工程本科课程概念性问题进行自动评分的可行性。我们将GPT-4o的评分表现与人类助教(TAs)在德克萨斯A&M大学MEEN 361课程的十个测验问题上进行了比较,每个问题约有225名学生作答。LLM和助教均遵循相同的教师提供的评分标准,以确保评分一致性。我们使用斯皮尔曼等级相关系数和均方根误差(RMSE)来评估GPT-4o和助教在零样本和少样本评分设置下排名一致性和分数准确性的对齐程度。在零样本设置下,GPT-4o与助教评分表现出强相关性,在十个数据集中有七个的斯皮尔曼等级相关系数超过0.6,最高达到0.9387。我们的分析表明,当评分标准直接明了时,GPT-4o表现良好,但在处理细微差别的答案时,特别是涉及评分标准中未出现的同义词时,则表现不佳。与人类助教相比,该模型在模棱两可的情况下也倾向于更严格地评分。总体而言,ChatGPT作为概念性问题评分工具显示出潜力,提供了可扩展性和一致性。
引用
@article{arxiv.2411.03659,
title = {Towards Scalable Automated Grading: Leveraging Large Language Models for Conceptual Question Evaluation in Engineering},
author = {Rujun Gao and Xiaosu Guo and Xiaodi Li and Arun Balajiee Lekshmi Narayanan and Naveen Thomas and Arun R. Srinivasa},
journal= {arXiv preprint arXiv:2411.03659},
year = {2024}
}
备注
21 pages, 21 figures