使用大语言模型为学生解题过程解释分配部分分数:以评分置信指数和个性化学生反馈达到人类水平评分精度
物理教育
2025-08-21 v3
摘要
本研究探讨了使用大语言模型(特别是 GPT-4o)对大量学生书面回答进行部分分数评分的可行性和潜在优势。学生被要求在课堂考试中写下他们对一个概念问题和两个数值计算问题解题推理过程的口头解释。然后根据包含三个项目的评分标准进行评分,每个项目为二分(1 或 0)。我们首先证明,使用 GPT-4o 进行机器评分,无需示例或参考答案,可以可靠地与人评阅者在 70%-80% 的所有案例中达成一致,这等于或高于两个人评阅者之间的一致水平。实现这一准确水平的两个关键方法是:1. 为每个评分标准项目添加针对机器评分初始错误的解释性语言;2. 运行评分过程 5 次并采用最频繁的结果。接下来,我们证明 5 次机器评分尝试之间结果的变化(以香农熵衡量)可以作为评分置信指数,使人评阅者只需审阅 10%-15% 的所有回答即可识别约 40% 的潜在错误评分。最后,我们证明使用 GPT-4o 编写清晰的部分评分结果解释是直接的。这些解释可用作学生反馈,使学生能够理解他们的分数并在必要时提出不同意见。几乎所有生成的反馈信息都被两位经验丰富的评阅者在 5 分制量表上评为 3 分或以上。整个评分和反馈生成过程每 100 名学生的回答花费约 5 美元,这展示了通过机器评分与人工输入和监督相结合来自动化劳动密集型评分过程的巨大潜力。
引用
@article{arxiv.2412.06910,
title = {Using Large Language Models to Assign Partial Credit to Students' Explanations of Problem-Solving Process: Grade at Human Level Accuracy with Grading Confidence Index and Personalized Student-facing Feedback},
author = {Zhongzhou Chen and Tong Wan},
journal= {arXiv preprint arXiv:2412.06910},
year = {2025}
}