超越人类主观性与错误:一种新型 AI 评分系统
人工智能
2024-05-08 v1
摘要
开放式问题的评分是教育中的高工作量、高影响力任务。自动化此项任务承诺能显著减少教育专业人员的工作负担,并通过规避人类主观性和错误实现更一致的学生评分结果。虽然近期 AI 技术的突破可能促进这种自动化,但尚未在大规模范围内实现。本文我们引入一种新型自动短答案评分(ASAG)系统。该系统基于在大学课程中涵盖广泛学科范围的大规模考试数据上进行微调的开源变换器模型。我们在第一次实验中对训练好的模型在广泛未知问题上的表现进行评估,发现其在广泛范围内的不可见问题上表现出高准确率,即使在不可见课程中也是如此。我们进一步将模型的性能与认证人类领域专家的性能进行比较:我们组装了另一个来自真实历史考试的数据集——该数据集中的历史成绩是由在受监管、法律约束的考试过程中评定给学生的,因此我们将其视为本实验的 ground truth。我们要求认证的人类领域专家和我们的模型再次对历史学生答案进行评分,而不透露历史成绩。最后,我们将获得的成绩与历史成绩进行比较(我们的 ground truth)。我们发现对于所考察的课程,模型的中位数绝对误差比人类重新评分小 44\%,这表明该模型在评分方面比人类更一致。这些结果表明,利用 AI 增强的评分可以减少人类主观性,提高一致性,从而最终提高公平性。
引用
@article{arxiv.2405.04323,
title = {Beyond human subjectivity and error: a novel AI grading system},
author = {Alexandra Gobrecht and Felix Tuma and Moritz Möller and Thomas Zöller and Mark Zakhvatkin and Alexandra Wuttig and Holger Sommerfeldt and Sven Schütt},
journal= {arXiv preprint arXiv:2405.04323},
year = {2024}
}