生成式评分:在结构化丰富问题自动反馈中接近人类水平的准确性
机器学习
2021-03-25 v5 计算机与社会
机器学习
摘要
规模化获取高质量教育受限于在如计算机编程、图形学和简答题等结构化领域中对开放式作业提供学生反馈的困难。这一问题已被证明极其困难:对人类而言,它需要大量手工劳动;对计算机而言,直到最近,达到任何接近人类水平的准确性都难以实现。在本文中,我们提出生成式评分:一种用于在规模化下提供反馈的新计算方法,能够准确对学生的作业评分并提供细致、可解释的反馈。我们的方法使用写为概率程序的学生认知生成式描述,来综合针对某问题的数百万个带标签示例解;然后我们基于此认知模型学习推断真实学生解的反馈。我们将方法应用于三种设置。在基于模块的编码中,我们在反馈上比先前最佳结果提升 50%,达到超人类准确性。在另外两个差异很大的领域——图形任务和短文本答案——中,我们分别比先前最先进水平大幅提升约 4 倍和 1.5 倍,接近人类准确性。在真实课堂中,我们运行了一项实验,使用我们的系统增强人类评分员,使评分准确性翻倍同时将评分时间减半。
引用
@article{arxiv.1905.09916,
title = {Generative Grading: Near Human-level Accuracy for Automated Feedback on Richly Structured Problems},
author = {Ali Malik and Mike Wu and Vrinda Vasavada and Jinpeng Song and Madison Coots and John Mitchell and Noah Goodman and Chris Piech},
journal= {arXiv preprint arXiv:1905.09916},
year = {2021}
}
备注
10 pages of content