利用人类反馈扩展教育数据集:众包工作者与比较判断的结合
计算与语言
2023-11-10 v2
摘要
机器学习模型在教育场景中有许多潜在有益应用,但其开发的关键障碍在于获取足够数据以训练这些模型。传统上,教育数据标注依赖高技能评分者使用复杂的多类量规,使得过程昂贵且难以扩展。一种更具可扩展性的替代方案是使用非专家众包工作者评估学生作业,然而,在使用非专家工作者时保持足够高的准确率和评分者间信度具有挑战性。本文报告了两项实验,研究使用非专家众包工作者和比较判断来评估复杂的学生数据。雇佣众包工作者评估学生对开放式阅读理解问题的回答。众包工作者被随机分配到两种条件之一:对照组,要求其判断答案正确或错误(即类别判断);处理组,向其展示相同问题与答案,但要求其判断两个候选答案中哪个更正确(即比较/基于偏好的判断)。我们发现,使用比较判断显著提高了两项任务的评分者间信度。这些结果与教育评估领域关于比较判断益处的既有文献一致,也与人工智能研究近期趋势相符——在非专家众包工作者提供模型输出的人类反馈时,比较判断正成为首选方法。然而,据我们所知,这些结果在证明结合比较判断与众包工作者评估教育数据的有益效果方面是新颖且重要的。
引用
@article{arxiv.2305.12894,
title = {Leveraging Human Feedback to Scale Educational Datasets: Combining Crowdworkers and Comparative Judgement},
author = {Owen Henkel and Libby Hills},
journal= {arXiv preprint arXiv:2305.12894},
year = {2023}
}