人类与自动化评估对进化问题开放式学生回答的比较
人工智能
2018-05-08 v1
摘要
书面回答能在理解学生对某一主题的推理方面提供丰富数据。然而,对其评分耗时耗力,导致许多教师放弃使用,仅作为单元或课程结束时的总结性评估的有限部分。机器学习(ML)的最新进展已产生计算方法来对书面回答中特定概念的有无进行评分。在此,我们将一个特定的 ML 程序——EvoGrader——的评分与人类对结构和内容相似但不同于该程序所训练问题的回答的评分进行比较。我们发现人类与 ML 评分之间存在显著的评分者间一致性。然而,人类与 ML 评分之间仍存在足够的系统性差异,因此我们建议仅将 ML 评分用于学生推理的形成性评估,而非总结性评估。
引用
@article{arxiv.1603.07029,
title = {Comparing Human and Automated Evaluation of Open-Ended Student Responses to Questions of Evolution},
author = {Michael J Wiser and Louise S Mead and James J Smith and Robert T Pennock},
journal= {arXiv preprint arXiv:1603.07029},
year = {2018}
}
备注
Submitted to ALife 2016